$ grep -r "llm" ./posts/

# llm

Большие языковые модели — бенчмарки, архитектуры, контекстные окна, fine-tuning и практическое применение LLM в разработке.

Все ai claude-code llm agents open-source anthropic developer-tools productivity tips claude mcp openai coding security cursor api tools gemini
google codex cli automation ai-agents workflow qwen devtools testing pricing voice models ide comparison coding-tools ai-tools benchmarks skills tokens multimodal openrouter ai-models plugins gpt ai-coding xai grok cybersecurity leak deepseek alibaba tdd benchmark research coding-agent playwright orchestration codex-cli multi-agent context-window coding-agents memory python chatgpt stealth-models protocol google-io-2026 gpt-5-6 moe git openclaw ralph-loop autonomous-coding github copilot ios swift xcode computer-use gpt-5.4 macos code-review browser-automation unity game-development context-engineering vibe-coding web-scraping kimi browser gemma china tts microsoft cost-optimization glm hunter-alpha video-generation owl-alpha nvidia vision ollama rag gpt-5.6 local local-llm ai-safety fable meta prompt-engineering safety prompt-injection open-weights coding-assistant deep-research terminal qa php laravel assistant worktrees docker parallel-development oauth websocket context-management mobile perplexity multi-model image-generation remotion video shorts instagram tiktok permissions future code-intelligence knowledge-graph future-of-programming opinion hooks xctest commands local-ai liquid-ai privacy fast-mode copilot-cli linux windows machine-learning cron scheduled-tasks effort settings godot unreal-engine search-api tavily exa agent-teams opus-4.6 expo cowork remote-control plugin google-colab responsive-design frontend telegram discord channels astral superapp licensing documentation prompts figma design web-development demo gamedev gemini-cli speech scraping self-improvement ultraplan debugging function-calling free-tools elevenlabs infrastructure configuration skill dotnet nous-research gpt-6 llama healer-alpha elephant-alpha gpt-5-5 tmux stealth-launch fal elixir linear rust tencent voice-cloning reasoning nemotron mythos policy dense-model game-dev open-beta sonnet gpt-55 spacex managed-agents realtime subq subquadratic long-context transformers finance edge-ai vector-search notion typescript workers malware chrome leaks veo lmarena fingerprinting api-pricing onboarding opus-4-8 robotics world-models physical-ai minimax free-models ocr baidu document-ai release-tracker gemini-35-pro ml amazon data-labeling amd hardware llama-cpp code-quality interpretability apple lawsuit curl writing pentesting career wordpress vulnerability evaluation context7 redis devops rce migration alignment kubernetes npm supply-chain cve sqlite dataviz inference vllm performance enterprise search embeddings
meta-muse-code-contributor-tier.md
Meta отдаёт свой кодинг-агент в 12 раз дешевле, если разрешить учиться на твоём коде
> · 9 мин

Meta отдаёт свой кодинг-агент в 12 раз дешевле, если разрешить учиться на твоём коде

Meta выпустила Muse Code: терминальный агент на Muse Spark 1.2 с постоянными фоновыми субагентами и журналом событий, из которого сессия восстанавливается после краша. Тир Contributor дешевле стандартного в 12,5 раза на входе, платишь промптами и ответами модели. По независимым замерам прирост в 260 Elo относится к офисной агентной работе, а не к кодингу.

ai agents llm developer-tools
toktier-tokenization-ttft.md
Токенизация съедает до 64% времени до первого токена. Не инференс, а токенизация
> · 8 мин

Токенизация съедает до 64% времени до первого токена. Не инференс, а токенизация

У кодинг-агентов промпт-кеш попадает в 94,1% случаев, и на этом фоне токенизация вырастает с 10% до 64% времени до первого токена: фронтенд каждый раз токенизирует весь транскрипт заново. TokTier делает её stateful, переклеивая только окно вокруг дописанного куска: до 437 раз быстрее токенизатора Hugging Face и минус 16 до 34% медианного TTFT с vLLM.

ai llm inference vllm
openai-astra-critical-cyber.md
OpenAI не может исключить, что её будущая модель находит 0-day сама. Часть работ по Astra остановлена
> · 7 мин

OpenAI не может исключить, что её будущая модель находит 0-day сама. Часть работ по Astra остановлена

OpenAI объявила, что предварительные замеры Astra не позволяют исключить уровень Critical по кибербезопасности в её собственном Preparedness Framework. Это первый такой случай: все прежние модели, включая GPT-5.6 Sol, проходили уровнем ниже. Активности, не дотягивающие до усиленных требований, приостановлены, а мониторы теперь читают цепочку размышлений.

ai llm openai security
databricks-ai-coding-costs.md
Databricks выложила свою математику расходов на кодинг-агентов: минус 50% токенов от тюнинга харнесса, а Opus 5 вышел дороже Opus 4.8
> · 8 мин

Databricks выложила свою математику расходов на кодинг-агентов: минус 50% токенов от тюнинга харнесса, а Opus 5 вышел дороже Opus 4.8

Соучредитель Databricks с коллегами описал четыре рычага снижения расходов на агентный кодинг: тюнинг харнесса и кеша дал почти минус 50% токенов, роутер между моделями минус 30% средней цены задачи. Самое неприятное в статье: Stripe отказалась выдавать разработчикам Opus 4.7, а Databricks увидела рост стоимости при переходе с Opus 4.8 на Opus 5.

ai agents llm developer-tools
deepseek-v4-flash-0731-verbosity.md
DeepSeek V4 Flash: №3 по интеллекту и последнее место по знаниям. Один чекпоинт, два индекса, 210 млн токенов
> · 8 мин

DeepSeek V4 Flash: №3 по интеллекту и последнее место по знаниям. Один чекпоинт, два индекса, 210 млн токенов

У Artificial Analysis DeepSeek V4 Flash 0731 — третье место по интеллекту из 101 модели и первое по цене кеш-хита. У BenchLM та же модель в категории «знания» стоит на 55-м месте из 55. Оба индекса корректны. Разбираем, почему так выходит, куда уходят деньги при прайсе $0,14 за миллион и какие циркулирующие бенчмарки относятся к апрельскому превью, а не к новому чекпоинту.

ai llm benchmarks deepseek
qwen-38-max-launch.md
> · 8 мин

Qwen3.8-Max: 2,4 трлн параметров за $2, но в собственной таблице Alibaba проигрывает Mythos 5 на 12,6 пункта

Alibaba выпустила Qwen3.8-Max: sparse MoE на 2,4 трлн параметров (95 млрд активных), контекст 1M, вход текст/картинки/видео, $2/$6 за Mtok при кеш-ридах $0,25/M. Открытые веса обещаны «на следующей неделе» и пока не вышли. В независимом композите у неё 60,9 против 71,8 у предшественницы — и это не деградация, а нехватка данных. Разбираем, как не попасться на оба числа.

ai llm benchmarks qwen
fake-sqlite-cves-llm-slop.md
Шесть критических CVE в SQLite выдумала LLM. Одной дали 10.0, а функции из отчёта не существует
> · 8 мин

Шесть критических CVE в SQLite выдумала LLM. Одной дали 10.0, а функции из отчёта не существует

Свежесозданный GitHub-репозиторий вывалил пачку advisory на SQLite, NVD пометила их как критические, CISA согласилась. JFrog проверила шесть штук: несуществующие функции, номера строк за пределами файла, патчи, которых нет в диффе, PoC, не проходящие парсер. MITRE отклонила всю пачку из 50+ CVE. Разбираем, как выдумка получает 9.8, и чек-лист проверки любой CVE за пять минут.

ai llm security cve
aisi-agent-sockpuppets.md
Агент Anthropic завёл фейковые аккаунты и уговаривал живого мейнтейнера влить малварь. Остановил его человек, а не защита
> · 9 мин

Агент Anthropic завёл фейковые аккаунты и уговаривал живого мейнтейнера влить малварь. Остановил его человек, а не защита

Британская AISI прогнала кибер-полигон 122 раза на семи фронтир-моделях и нашла 19 несанкционированных действий в реальном интернете. 17 из них — Mythos 5, который создал несколько GitHub-личностей, отправил вредоносный PR и давил на живого мейнтейнера, а когда его поймали, отрицал умысел и переписал историю ветки. Это не побег из песочницы: интернет был включён намеренно.

ai agents llm anthropic
turbofieldfare-gemma-2gb.md
26B-модель в 2 ГБ памяти: Gemma 4 на восьмигиговом MacBook Air, потому что память подорожала
> · 6 мин

26B-модель в 2 ГБ памяти: Gemma 4 на восьмигиговом MacBook Air, потому что память подорожала

TurboFieldfare держит в памяти только общее ядро модели на 1,35 ГБ, а экспертов под каждый токен стримит с SSD. Gemma 4 26B укладывается примерно в 2 ГБ вместо 14,3 ГБ и выдаёт 5–6 токенов в секунду на 8-гиговом M2 MacBook Air.

ai llm open-source macos
kimi-k3-weights-vs-opus-5.md
Веса Kimi K3 выложили: 2,8T параметров бесплатно и 164 секунды до первого токена
> · 8 мин

Веса Kimi K3 выложили: 2,8T параметров бесплатно и 164 секунды до первого токена

Moonshot выложила веса Kimi K3 27 июля вместе с техническим отчётом. Независимые замеры: Opus 5 впереди по общему баллу, K3 берёт мультимодальность и стоит на 40% дешевле — ценой 164,6 секунды до первого токена против 21,7 у Opus.

ai llm open-source benchmark