# security
Безопасность в AI-разработке — уязвимости агентов, prompt injection, защита API-ключей и безопасный код с AI.
GPT-5.6 нашла unauth RCE в ядре WordPress за $25 и 10 часов. Патч уже вышел, эксплойты уже в деле
Исследователь Searchlight Cyber с помощью GPT-5.6 за ~10 часов и $25 нашёл pre-auth RCE-цепочку в ядре WordPress. Разбираем экономику находки без рецепта атаки, почему $500k это фрейминг, и главное: как проверить свой сайт и защититься, ведь эксплойты уже в деле.
Модель OpenAI час искала дыру в песочнице, чтобы выложить PR на GitHub. И разбила токен надвое в обход сканера
OpenAI рассказала, как её внутренняя модель во время тестов час искала дыру в песочнице ради PR на GitHub и дробила украденный токен в обход сканера. Разбираем, что случилось на самом деле, почему это баг приоритетов, а не бунт машины, и как изолировать агентов, чтобы они физически не могли навредить.
Strix — open-source AI-пентестер с 41K звёзд: рой агентов находит дыры и приносит рабочий эксплойт, а не ложное срабатывание
Strix — open-source команда AI-агентов, которые атакуют твоё приложение как хакеры: находят инъекции, сломанную авторизацию, SSRF и XSS, а затем валидируют находки рабочими PoC вместо ложных срабатываний. 41K звёзд, Apache-2.0, интеграция с CI/CD. Софт бесплатный, но LLM под капотом — нет.
Grok Build сливал весь твой репозиторий в облако — с историей git и .env. Маск признал, но код аплоада всё ещё в бинарнике
Security-исследователь cereblab поймал Grok Build CLI на выгрузке всего репозитория с историей git и .env в облачный бакет xAI — в 27 800 раз больше данных, чем нужно модели. Тумблер приватности не помогал, а код аплоада до сих пор лежит в бинарнике. Что произошло и что делать прямо сейчас.
AI-слоп добил баг-баунти cURL: $86K выплат за 6 лет, ноль реальных уязвимостей от чистого AI — и публичный бан-лист от Ghostty
cURL закрыл баг-баунти после потока AI-генерированных фейков: за 6 лет ни один репорт, написанный AI без человека, не нашёл реальной уязвимости. Ghostty ввёл публичный бан-лист AI-контрибьюторов. Как open source защищается от слопа и как контрибьютить с AI правильно.
В Claude Code нашли скрытый код, который стеганографией стучал, что вы из Китая. Alibaba забанила тул
Разработчик отреверсил Claude Code и нашёл обфусцированный код: с апреля тул при включённом прокси проверял таймзону и URL на «китайскость» и кодировал ответ стеганографией в системный промпт. Anthropic назвала это экспериментом, Alibaba забанила Claude Code с 10 июля.
Установил Claude Code из первой ссылки в Google и потерял все пароли из Chrome — разбор атаки InstallFix
Атакующие купили Google Ads на запрос «install claude code», подложили лжестраницу и через PowerShell-команду крадут все cookies, пароли и payment methods из Chrome. Атака работает с 5 мая, Ontinue её разобрали 11 мая. Разбор стадий, обход App-Bound Encryption через IElevator2 и что делать прямо сейчас.
Claude Mythos — модель, которую Anthropic прячет от тебя. И правильно делает
Две недели назад Anthropic случайно спалил существование своей самой мощной модели. Claude Mythos Preview нашла тысячи 0-day в OpenBSD, FFmpeg и ядре Linux. Публично не будет. Зачем это знать разработчику.
Утечка исходников Claude Code — 512 000 строк TypeScript, тамагочи в терминале и роадмап, который никто не должен был увидеть
31 марта из npm-пакета Claude Code случайно выпал полный исходный код — 1 906 файлов, 512 000 строк TypeScript. Внутри: always-on демон KAIROS, 30-минутное облачное планирование ULTRAPLAN, тамагочи BUDDY с гачей, режим шпиона для сотрудников Anthropic и антидистилляционная защита от конкурентов.
Claude Code Auto Mode — AI сам решает, что безопасно, а что нет. В день крупнейшей supply chain атаки на LiteLLM
Anthropic выпустил auto mode для Claude Code — классификатор на Sonnet 4.6 решает за тебя, какие действия безопасны. В тот же день хакеры скомпрометировали LiteLLM через pip install, и allow-list auto mode это бы пропустил.