diffnotes.tech — тех-блог о программировании, AI и DevOps
80% на SWE-bench это не 80% решённых задач: как кодинг-лидерборды меряют ретривал, а не кодинг
Четыре работы за месяц показали, что кодинг-лидерборды меряют ретривал и обвязку, а не кодинг: OpenAI зарубила два своих бенчмарка, Cursor нашёл 63% найденных фиксов, RuBench поймал GPT-5.6 на добывании ответов с диска. Плюс инструкция, как честно померить агента на своём репозитории.
GPT-5.6 нашла unauth RCE в ядре WordPress за $25 и 10 часов. Патч уже вышел, эксплойты уже в деле
Исследователь Searchlight Cyber с помощью GPT-5.6 за ~10 часов и $25 нашёл pre-auth RCE-цепочку в ядре WordPress. Разбираем экономику находки без рецепта атаки, почему $500k это фрейминг, и главное: как проверить свой сайт и защититься, ведь эксплойты уже в деле.
Google выпустила три Gemini и снова не выпустила 3.5 Pro. Зато уже учит Gemini 4
Google выпустила Gemini 3.6 Flash, Flash-Lite и закрытую Flash Cyber, но снова отложила флагман 3.5 Pro и начала учить Gemini 4. Разбираем цены, бенчмарки, дуал-юз кибермодели и подводные камни, включая баг с квотой в Antigravity и недоступность из РФ.
Модель OpenAI час искала дыру в песочнице, чтобы выложить PR на GitHub. И разбила токен надвое в обход сканера
OpenAI рассказала, как её внутренняя модель во время тестов час искала дыру в песочнице ради PR на GitHub и дробила украденный токен в обход сканера. Разбираем, что случилось на самом деле, почему это баг приоритетов, а не бунт машины, и как изолировать агентов, чтобы они физически не могли навредить.
Дедлайн Fable 5 всё-таки наступил: Max получил модель навсегда, Pro отправили платить по $10/$50 за миллион токенов
После трёх продлений Anthropic не стала продлевать промо Fable 5 в четвёртый раз, а разделила пользователей по тарифам: Max получил модель навсегда, Pro перевели на оплату по токенам $10/$50 за миллион. Считаем реальную стоимость сессии, разбираем разовый кредит $100 и куда уходить с Pro.
На чём кодить дёшево в июле 2026: GLM-5.2 обошёл GPT-5.5 на SWE-Pro, MiniMax M3 стоит копейки — но «open» не значит «на твоём ноуте»
Открытые веса догнали закрытых: GLM-5.2 обходит GPT-5.5 на SWE-bench Pro, MiniMax M3 стоит $0.30 за миллион токенов, а DeepSeek V4-Pro кодит почти как Opus за десятую часть цены. Сравниваем цену, бенчмарки, контекст и лицензии — и почему «open-weight» не значит «влезет в твой ноут».
ai-job-search — Claude Code ищет тебе работу: оценивает вакансии, кроит резюме и пишет сопроводительное, пока второй агент его критикует
ai-job-search превращает Claude Code в ассистента по трудоустройству: /setup строит профиль, /scrape ищет вакансии с рейтингом фита, /apply кроит резюме на LaTeX и пишет сопроводительное, а второй агент изучает компанию и критикует черновик. Правило честности: навыки не выдумывает. 21K звёзд, MIT.
Orca — ADE для флота параллельных агентов: Claude Code, Codex и OpenCode бок о бок в worktree, а рулить стадом можно с телефона
Orca — Agent Development Environment: гоняет Claude Code, Codex, OpenCode и Pi параллельно, каждого в изолированном git-worktree, всё в одном окне. Кроссплатформенна, есть мобильный компаньон с пушами, когда агент закончил. 19K звёзд, MIT, за спиной Y Combinator.
Voicebox — локальная замена ElevenLabs и WisprFlow в одном приложении: клон голоса, 7 TTS-движков и диктовка, всё на твоей машине
Voicebox — локальная open-source голосовая студия: клонирует голос из пары секунд аудио, синтезирует речь на 23 языках через 7 TTS-движков, диктует в любое поле по хоткею и даёт голос MCP-агенту. Всё на твоей машине, ничего не улетает. Бесплатная замена ElevenLabs и WisprFlow сразу.
$ cat /dev/blog/updates
> Свежие заметки о программировании,
> DevOps и AI — прямо в мессенджер