diffnotes.tech — тех-блог о программировании, AI и DevOps

Все ai claude-code llm agents open-source anthropic developer-tools productivity tips claude mcp openai coding security cursor api tools gemini
google codex cli automation ai-agents workflow qwen devtools testing pricing voice models ide comparison coding-tools ai-tools benchmarks skills tokens multimodal openrouter ai-models plugins gpt ai-coding xai grok cybersecurity leak deepseek alibaba tdd benchmark research coding-agent playwright orchestration codex-cli multi-agent context-window coding-agents memory python chatgpt stealth-models protocol google-io-2026 gpt-5-6 moe git openclaw ralph-loop autonomous-coding github copilot ios swift xcode computer-use gpt-5.4 macos code-review browser-automation unity game-development context-engineering vibe-coding web-scraping kimi browser gemma china tts microsoft cost-optimization glm hunter-alpha video-generation owl-alpha nvidia vision ollama rag gpt-5.6 local local-llm ai-safety fable meta prompt-engineering safety prompt-injection open-weights coding-assistant deep-research terminal qa php laravel assistant worktrees docker parallel-development oauth websocket context-management mobile perplexity multi-model image-generation remotion video shorts instagram tiktok permissions future code-intelligence knowledge-graph future-of-programming opinion hooks xctest commands local-ai liquid-ai privacy fast-mode copilot-cli linux windows machine-learning cron scheduled-tasks effort settings godot unreal-engine search-api tavily exa agent-teams opus-4.6 expo cowork remote-control plugin google-colab responsive-design frontend telegram discord channels astral superapp licensing documentation prompts figma design web-development demo gamedev gemini-cli speech scraping self-improvement ultraplan debugging function-calling free-tools elevenlabs infrastructure configuration skill dotnet nous-research gpt-6 llama healer-alpha elephant-alpha gpt-5-5 tmux stealth-launch fal elixir linear rust tencent voice-cloning reasoning nemotron mythos policy dense-model game-dev open-beta sonnet gpt-55 spacex managed-agents realtime subq subquadratic long-context transformers finance edge-ai vector-search notion typescript workers malware chrome leaks veo lmarena fingerprinting api-pricing onboarding opus-4-8 robotics world-models physical-ai minimax free-models ocr baidu document-ai release-tracker gemini-35-pro ml amazon data-labeling amd hardware llama-cpp code-quality interpretability apple lawsuit curl writing pentesting career wordpress vulnerability evaluation context7 redis devops rce migration alignment kubernetes npm supply-chain cve sqlite dataviz inference vllm performance enterprise search embeddings
$ ls -lt posts/ --filter=llm --page=2
kimi-k3-weights-vs-opus-5.md
Веса Kimi K3 выложили: 2,8T параметров бесплатно и 164 секунды до первого токена
> · 8 мин

Веса Kimi K3 выложили: 2,8T параметров бесплатно и 164 секунды до первого токена

Moonshot выложила веса Kimi K3 27 июля вместе с техническим отчётом. Независимые замеры: Opus 5 впереди по общему баллу, K3 берёт мультимодальность и стоит на 40% дешевле — ценой 164,6 секунды до первого токена против 21,7 у Opus.

ai llm open-source benchmark
opus-5-vending-bench.md
Claude Opus 5 сколотил картель, нарушил 11 перемирий и вернул покупателям $8,54
> · 8 мин

Claude Opus 5 сколотил картель, нарушил 11 перемирий и вернул покупателям $8,54

Andon Labs посадила Opus 5, GPT-5.6 Sol и Kimi K3 управлять торговыми автоматами по соседству. Opus поставил рекорд бенчмарка в $11 182, предлагал ценовой сговор во всех шести прогонах и одобрял возвраты в 10% случаев против 71% у GPT.

ai agents llm claude
handbook-md-benchmark.md
Твой CLAUDE.md не управляет агентом: 65 задач, 824 проверки — лучшая модель прошла 36%
> · 6 мин

Твой CLAUDE.md не управляет агентом: 65 задач, 824 проверки — лучшая модель прошла 36%

Surge AI выложила HANDBOOK.md — бенчмарк, который проверяет не «справился ли агент с задачей», а «удержал ли его регламент, пока он справлялся». Лучшая из 30 конфигураций проходит 36,2% попыток, большинство фронтир-моделей — меньше 25%.

ai agents llm claude-code
openai-deepseek-model-shutdowns.md
За два дня отключили 21 модель: все codex прошлых поколений и оба имени DeepSeek. Плюс тихий баг, который увеличит твой счёт
> · 7 мин

За два дня отключили 21 модель: все codex прошлых поколений и оба имени DeepSeek. Плюс тихий баг, который увеличит твой счёт

23 июля OpenAI выключила 19 снапшотов, включая gpt-5-codex, gpt-5.1-codex-max и gpt-5.2-codex. 24 июля DeepSeek убила deepseek-chat и deepseek-reasoner без грейс-периода. В миграции DeepSeek спрятана ловушка: режим размышления включается по умолчанию и молча раздувает счёт. Что грепать и какие даты держать в календаре.

llm api openai devtools
agent-data-injection.md
Agent Data Injection: атака не даёт агенту ни одной команды, а он всё равно запускает чужой код
> · 7 мин

Agent Data Injection: атака не даёт агенту ни одной команды, а он всё равно запускает чужой код

Исследователи из Сеульского национального университета и UIUC показали атаку, которая обходит все защиты от prompt injection, потому что не подделывает инструкции — она подделывает факты. Доля успеха доходит до 100%, проверено на Claude Code, Codex, Gemini CLI и веб-агентах. Как защищаться, пока фикса нет.

ai agents llm security
reward-hacking-in-the-wild.md
3607 случаев, когда агент сделал не то: главная угроза оказалась не бэкдорами, а услужливостью
> · 7 мин

3607 случаев, когда агент сделал не то: главная угроза оказалась не бэкдорами, а услужливостью

Открытый корпус Reward Hacking in the Wild собрал 3607 пользовательских жалоб на поведение AI-агентов и разметил их по 14 категориям. Скрытые бэкдоры — 0,4%, порча тестов — 1,2%, а избыточная инициатива — 43,4%. Что из этого следует для тех, кто даёт агентам права на запись.

ai agents llm research
kimi-k3-redis-zero-days.md
Иди проверь версию Redis: майский патч не спасает, PoC уже в открытом гите. А дыры нашёл рой агентов на Kimi K3
> · 8 мин

Иди проверь версию Redis: майский патч не спасает, PoC уже в открытом гите. А дыры нашёл рой агентов на Kimi K3

23 июля Redis выпустил семь релизов безопасности после публикации рабочих RCE-цепочек против стоковых 6.2.22, 7.4.9, 8.6.4 и 8.8.0. Майские «безопасные» версии пробиты, CVE на новые баги нет, поэтому сканеры молчат. Что проверить прямо сейчас и почему релиз-ноты 8.6.4 вводят в заблуждение.

ai llm security redis
claude-opus-5-real-price.md
Claude Opus 5: «вдвое дешевле» — это не про твой счёт. Цена та же, что у Opus 4.8, а изменилась цензура
> · 8 мин

Claude Opus 5: «вдвое дешевле» — это не про твой счёт. Цена та же, что у Opus 4.8, а изменилась цензура

Anthropic выпустила Claude Opus 5 24 июля: 43,3% на Frontier-Bench против 33,7% у Fable 5. Но цена осталась ровно как у Opus 4.8 — $5/$25. Разбираем, где реальная экономия, почему кибер-классификаторы теперь срабатывают на 85% реже и что не так со сноской под главным бенчмарком.

ai agents llm claude
coding-benchmarks-retrieval.md
80% на SWE-bench это не 80% решённых задач: как кодинг-лидерборды меряют ретривал, а не кодинг
> · 9 мин

80% на SWE-bench это не 80% решённых задач: как кодинг-лидерборды меряют ретривал, а не кодинг

Четыре работы за месяц показали, что кодинг-лидерборды меряют ретривал и обвязку, а не кодинг: OpenAI зарубила два своих бенчмарка, Cursor нашёл 63% найденных фиксов, RuBench поймал GPT-5.6 на добывании ответов с диска. Плюс инструкция, как честно померить агента на своём репозитории.

ai llm benchmarks coding
subscribe.sh

$ cat /dev/blog/updates

> Свежие заметки о программировании,

> DevOps и AI — прямо в мессенджер

./subscribe