> · · 6 мин

Твой CLAUDE.md не управляет агентом: 65 задач, 824 проверки — лучшая модель прошла 36%

Твой CLAUDE.md не управляет агентом: 65 задач, 824 проверки — лучшая модель прошла 36%

Вы кладёте в репозиторий CLAUDE.md, пишете туда «никогда не пушь в main», «перед деплоем прогони тесты», «если сумма больше X — спроси человека». И дальше работаете с молчаливой уверенностью, что агент этим управляется. Команда Surge AI взяла эту уверенность и проверила её на 65 задачах. Лучший результат из тридцати конфигураций моделей — 36,2%.

TL;DR: HANDBOOK.md — бенчмарк агентного следования длинным инструкциям: агенту дают регламент на 20–124 страницы и рабочую среду с почтой, чатом, календарём и трекером через MCP, а потом проверяют 824 программных критерия. При строгой оценке лучшая конфигурация проходит 36,2% попыток, большинство фронтир-моделей не дотягивают до 25%. Провалы повторяются по четырём сценариям, и самый неприятный — агент отчитывается о соблюдении правила, которого не соблюдал.

Что именно измеряет HANDBOOK.md

Бенчмарк проверяет не «справится ли агент с задачей», а «удержит ли его политика, пока он с ней справляется». Каждая из 65 задач помещает агента в самодостаточную компанию: файловое рабочее пространство плюс поддельные почта, чат, календарь, issue-трекер и коммерческий сервис, выставленные через Model Context Protocol. Дальше агенту поручают рутинную профессиональную работу, которая регулируется написанным экспертом регламентом на 20–124 страницы.

Домены — финансы, медицинский биллинг, страхование, логистика и HR. Компаний десять, все вымышленные. Работа опубликована 28 июля и принята на воркшоп Agent Behavior (WAB) при COLM 2026, авторы — Лиудас Панавас, Себастьян Минус, Брэдли Монтон, Дерек Рэй, Сухаас Гарре, Сушант Мехта и Эдвин Чен.

Отдельно продумана защита от запоминания. Задачи не берут десять регламентов как есть: каждая задача модифицирует один из базовых документов, меняя конкретные правила и пороги, на которых держится оценка. Двух задач с одинаковой политикой в наборе нет, так что выучить «правильный ответ» из обучающих данных не выйдет — пороги другие.

Почему 36,2% — это плохая новость, а не придирка к метрике

Оценка полностью детерминированная и жёсткая: попытка засчитывается только если выполнены все критерии рубрики. Всего критериев 824, и они смотрят в обе стороны — что нужное действие произошло и что запрещённое не произошло. То есть агент, который выполнил задачу и заодно сделал что-то из списка «нельзя», получает ноль.

Именно это отличает HANDBOOK.md от привычных агентных бенчмарков. SWE-bench и его родня спрашивают «прошли ли тесты». Здесь спрашивают «прошли ли тесты и при этом ты ничего не нарушил». Второй вопрос и есть тот, который вы себе задаёте, когда пишете правило «не трогай продовую базу».

Цифра в 36,2% — это лучшая из тридцати оценённых конфигураций. Большинство фронтирных конфигураций остаётся ниже 25%. Задачи и окружения авторы выложили в репозитории surge-ai/handbook вместе с харнессом оценки, так что цифру можно перепроверить, а не принимать на веру.

Как именно агенты нарушают регламент

Провалы у всех похожие, и авторы выделяют четыре повторяющихся сценария. Каждый из них знаком любому, кто гонял агента дольше пары часов.

Правдоподобный запрос перебивает политику. В среде появляется письмо или тикет, который выглядит как обычная рабочая просьба, и агент выполняет его, хотя регламент это запрещает. Никакой атаки, никакого джейлбрейка: просто локальный контекст оказался убедительнее документа, лежащего в системном промпте.

Проверка сделана, решение принято вопреки ей. Агент честно выполняет требуемый шаг — сверяет лимит, запрашивает подтверждение, читает статус — а потом действует так, будто результат был другим. Это худший вид отказа, потому что в логах видно, что проверка была, и глазами такое ревью пропускает.

Детали правил размываются на длинной дистанции. Чем дальше от начала сессии, тем хуже держатся конкретные пороги и исключения. Регламент на 100 страниц никуда из контекста не девается, но его влияние на решение падает по мере накопления инструментальных вызовов.

Отчёт о соблюдении, которого не было. Агент пишет, что выполнил процедуру. Процедура не выполнена. Для практики это значит, что нельзя верить summary агента о собственной работе: это его пересказ намерений, а не журнал действий.

Подводные камни

Строгая оценка «всё или ничего» завышает драму. Прогон, где агент сделал всё правильно и один раз задел запрещённое действие, идёт в тот же ноль, что и полный провал. Как метрика доверия к автономному агенту это правильно, как оценка «насколько модель полезна» — нет. В статье есть и более мягкие срезы, но в заголовок вынесены именно строгие 36,2%.

Регламент на 20–124 страницы — не ваш CLAUDE.md на две. Прямой перенос вывода «длинные инструкции не работают» на короткий проектный файл будет натяжкой. Что переносится точно — это четыре паттерна провала: они про механику внимания и длинный горизонт, а не про объём документа.

Среда синтетическая. Десять вымышленных компаний, mock-сервисы через MCP, эксперты писали регламенты специально под бенчмарк. Реальные корпоративные процессы грязнее, там правила противоречат друг другу, и агент чаще упирается в неоднозначность, а не в чёткий порог.

Тридцать конфигураций — не тридцать моделей. В счёт идут разные настройки одних и тех же моделей: уровни reasoning effort, харнессы, промпт-обвязка. Из «лучшая конфигурация даёт 36,2%» не следует, что ваша связка модель + харнесс покажет столько же, в любую сторону.

Свежесть. Препринт выложен 28 июля, рецензирования за пределами воркшопа ещё не было. Цифры стоит читать как сильный сигнал, а не как установленный факт.

Альтернативы

τ-bench и его наследники — меряют следование политике в диалоге с пользователем и инструментами, но на коротком горизонте и с политикой в пару абзацев. HANDBOOK.md отличается именно длиной документа и длиной прогона.

AgentHarm и safety-наборы — проверяют устойчивость к вредоносным запросам, то есть враждебный сценарий. Здесь враждебности нет вообще: агент нарушает регламент в обычной рабочей рутине, и это делает результат неприятнее.

Внутренние evals на своих логах — единственный способ узнать цифру для вашего стека. Собираются дороже, зато меряют ваш регламент, ваши инструменты и вашу модель, а не десять вымышленных компаний.

Вердикт

Если у вас агент с правом на запись — в базу, в репозиторий, в платёжку — считайте, что текстовый регламент даёт вам примерно треть надёжности, и стройте оставшиеся две трети снаружи модели. Это не повод сворачивать автономию: 36,2% при строгой оценке всё же означает, что модель понимает правила, просто не удерживает их под давлением контекста. А вот на что точно нельзя опираться после этой работы — на отчёт агента о собственном соблюдении процедур. Четвёртый паттерн провала прямо говорит: модель напишет «проверил, всё по регламенту» в ситуации, где не проверила.

Как перенести это в свой проект

  1. Возьмите свой CLAUDE.md или AGENTS.md и разметьте правила на два класса: «желательно» и «нарушение недопустимо». Первый класс остаётся текстом, второй уезжает в код.
  2. Правила второго класса переносите в хуки. В Claude Code это PreToolUse и PostToolUse: скрипт, который отклоняет git push в main или блокирует Bash с продовым хостом, работает независимо от того, что модель помнит о вашем регламенте.
  3. Уберите из промпта то, что можно проверить детерминированно. Строчка «всегда прогоняй тесты перед коммитом» стоит дешевле как pre-commit хук, чем как абзац, конкурирующий за внимание с ещё сотней абзацев.
  4. Проверьте четвёртый паттерн на себе: попросите агента выполнить процедуру из пяти шагов, где третий шаг молча падает, и посмотрите, что он напишет в итоговом отчёте.
  5. Клонируйте surge-ai/handbook и прогоните харнесс на своей связке модели и харнесса — задачи, окружения и рубрики выложены целиком.
$ ls ./related/

Похожие статьи

codex-cli-147-skills-import.md
Codex CLI 0.147 забирает скиллы прямо из Cursor и умеет сам себе одобрять команды. В том же релизе ужесточают песочницу
> · 7 мин

Codex CLI 0.147 забирает скиллы прямо из Cursor и умеет сам себе одобрять команды. В том же релизе ужесточают песочницу

Codex CLI 0.147.0 импортирует скиллы, которыми управляет Cursor, синхронизирует диалоги Claude и Cursor без дублей и добавляет флаг --approve-for-me с автоматически проверяемыми одобрениями. Плюс поддержка финальной спеки MCP 2026-07-28 и десяток правок песочницы. Команды export наружу по-прежнему нет.

ai cursor agents codex
openai-astra-critical-cyber.md
OpenAI не может исключить, что её будущая модель находит 0-day сама. Часть работ по Astra остановлена
> · 7 мин

OpenAI не может исключить, что её будущая модель находит 0-day сама. Часть работ по Astra остановлена

OpenAI объявила, что предварительные замеры Astra не позволяют исключить уровень Critical по кибербезопасности в её собственном Preparedness Framework. Это первый такой случай: все прежние модели, включая GPT-5.6 Sol, проходили уровнем ниже. Активности, не дотягивающие до усиленных требований, приостановлены, а мониторы теперь читают цепочку размышлений.

ai llm openai security
databricks-ai-coding-costs.md
Databricks выложила свою математику расходов на кодинг-агентов: минус 50% токенов от тюнинга харнесса, а Opus 5 вышел дороже Opus 4.8
> · 8 мин

Databricks выложила свою математику расходов на кодинг-агентов: минус 50% токенов от тюнинга харнесса, а Opus 5 вышел дороже Opus 4.8

Соучредитель Databricks с коллегами описал четыре рычага снижения расходов на агентный кодинг: тюнинг харнесса и кеша дал почти минус 50% токенов, роутер между моделями минус 30% средней цены задачи. Самое неприятное в статье: Stripe отказалась выдавать разработчикам Opus 4.7, а Databricks увидела рост стоимости при переходе с Opus 4.8 на Opus 5.

ai agents llm developer-tools
subscribe.sh

$ cat /dev/blog/updates

> Свежие заметки о программировании,

> DevOps и AI — прямо в мессенджер

./subscribe