# ai
Искусственный интеллект в разработке — новости моделей, сравнения, инструменты и практики использования AI для написания кода и автоматизации.
Твой CLAUDE.md не управляет агентом: 65 задач, 824 проверки — лучшая модель прошла 36%
Surge AI выложила HANDBOOK.md — бенчмарк, который проверяет не «справился ли агент с задачей», а «удержал ли его регламент, пока он справлялся». Лучшая из 30 конфигураций проходит 36,2% попыток, большинство фронтир-моделей — меньше 25%.
Codex теперь рулится голосом, а мультипапочный проект читает только один AGENTS.md
OpenAI 23 июля привезла ChatGPT Voice в десктопные приложения: голосом можно запускать и проверять задачи Codex в других тредах, а на macOS включается Screen context. Плюс мультипапочные проекты с неочевидным поведением конфигов и релиз Codex CLI 0.145.0, где /import переносит настройки из Cursor и Claude Code.
Agent Data Injection: атака не даёт агенту ни одной команды, а он всё равно запускает чужой код
Исследователи из Сеульского национального университета и UIUC показали атаку, которая обходит все защиты от prompt injection, потому что не подделывает инструкции — она подделывает факты. Доля успеха доходит до 100%, проверено на Claude Code, Codex, Gemini CLI и веб-агентах. Как защищаться, пока фикса нет.
3607 случаев, когда агент сделал не то: главная угроза оказалась не бэкдорами, а услужливостью
Открытый корпус Reward Hacking in the Wild собрал 3607 пользовательских жалоб на поведение AI-агентов и разметил их по 14 категориям. Скрытые бэкдоры — 0,4%, порча тестов — 1,2%, а избыточная инициатива — 43,4%. Что из этого следует для тех, кто даёт агентам права на запись.
Иди проверь версию Redis: майский патч не спасает, PoC уже в открытом гите. А дыры нашёл рой агентов на Kimi K3
23 июля Redis выпустил семь релизов безопасности после публикации рабочих RCE-цепочек против стоковых 6.2.22, 7.4.9, 8.6.4 и 8.8.0. Майские «безопасные» версии пробиты, CVE на новые баги нет, поэтому сканеры молчат. Что проверить прямо сейчас и почему релиз-ноты 8.6.4 вводят в заблуждение.
Claude Opus 5: «вдвое дешевле» — это не про твой счёт. Цена та же, что у Opus 4.8, а изменилась цензура
Anthropic выпустила Claude Opus 5 24 июля: 43,3% на Frontier-Bench против 33,7% у Fable 5. Но цена осталась ровно как у Opus 4.8 — $5/$25. Разбираем, где реальная экономия, почему кибер-классификаторы теперь срабатывают на 85% реже и что не так со сноской под главным бенчмарком.
Claude советует код, которого уже нет. Как научить его искать самое свежее
Claude по умолчанию отвечает из обучающих данных с отсечкой (у Fable 5 это январь 2026) и советует снятые API и несуществующие версии. Собрал рабочие приёмы, чтобы он лез в актуальные доки и веб: встроенный поиск с датовой привязкой, MCP context7, правила в CLAUDE.md, своя команда /latest, субагенты и хуки. Плюс честно про то, где это окупается, а где только жжёт токены.
80% на SWE-bench это не 80% решённых задач: как кодинг-лидерборды меряют ретривал, а не кодинг
Четыре работы за месяц показали, что кодинг-лидерборды меряют ретривал и обвязку, а не кодинг: OpenAI зарубила два своих бенчмарка, Cursor нашёл 63% найденных фиксов, RuBench поймал GPT-5.6 на добывании ответов с диска. Плюс инструкция, как честно померить агента на своём репозитории.
GPT-5.6 нашла unauth RCE в ядре WordPress за $25 и 10 часов. Патч уже вышел, эксплойты уже в деле
Исследователь Searchlight Cyber с помощью GPT-5.6 за ~10 часов и $25 нашёл pre-auth RCE-цепочку в ядре WordPress. Разбираем экономику находки без рецепта атаки, почему $500k это фрейминг, и главное: как проверить свой сайт и защититься, ведь эксплойты уже в деле.
Google выпустила три Gemini и снова не выпустила 3.5 Pro. Зато уже учит Gemini 4
Google выпустила Gemini 3.6 Flash, Flash-Lite и закрытую Flash Cyber, но снова отложила флагман 3.5 Pro и начала учить Gemini 4. Разбираем цены, бенчмарки, дуал-юз кибермодели и подводные камни, включая баг с квотой в Antigravity и недоступность из РФ.