diffnotes.tech — тех-блог о программировании, AI и DevOps
Реранкер на 0,6B обошёл модель в семь раз больше. Но только на одном бенчмарке и не для коммерции
jina-reranker-v3.5 показывает 63,20 nDCG@10 на BEIR против 62,28 у Qwen3-Reranker-4B, то есть обходит модель в семь раз больше при том же интерфейсе и drop-in замене v3. На юридике, медицине и мультиязычном поиске четырёхмиллиардная модель по-прежнему впереди, а веса лежат под некоммерческой лицензией CC BY-NC 4.0.
Claude Code теперь бежит на твоём железе. Код остаётся у тебя, а всё, что Claude прочитал, нет
Anthropic открыла публичную бету self-hosted environments: сессии Claude Code запускаются на своей инфраструктуре, внутри своей сети. Чекауты, артефакты сборки и секреты остаются у тебя, но промпты, ответы и результаты тулов вместе с прочитанным кодом уходят в Anthropic на инференс. Организациям на нулевом хранении данных фича недоступна.
Meta отдаёт свой кодинг-агент в 12 раз дешевле, если разрешить учиться на твоём коде
Meta выпустила Muse Code: терминальный агент на Muse Spark 1.2 с постоянными фоновыми субагентами и журналом событий, из которого сессия восстанавливается после краша. Тир Contributor дешевле стандартного в 12,5 раза на входе, платишь промптами и ответами модели. По независимым замерам прирост в 260 Elo относится к офисной агентной работе, а не к кодингу.
Токенизация съедает до 64% времени до первого токена. Не инференс, а токенизация
У кодинг-агентов промпт-кеш попадает в 94,1% случаев, и на этом фоне токенизация вырастает с 10% до 64% времени до первого токена: фронтенд каждый раз токенизирует весь транскрипт заново. TokTier делает её stateful, переклеивая только окно вокруг дописанного куска: до 437 раз быстрее токенизатора Hugging Face и минус 16 до 34% медианного TTFT с vLLM.
Codex CLI 0.147 забирает скиллы прямо из Cursor и умеет сам себе одобрять команды. В том же релизе ужесточают песочницу
Codex CLI 0.147.0 импортирует скиллы, которыми управляет Cursor, синхронизирует диалоги Claude и Cursor без дублей и добавляет флаг --approve-for-me с автоматически проверяемыми одобрениями. Плюс поддержка финальной спеки MCP 2026-07-28 и десяток правок песочницы. Команды export наружу по-прежнему нет.
OpenAI не может исключить, что её будущая модель находит 0-day сама. Часть работ по Astra остановлена
OpenAI объявила, что предварительные замеры Astra не позволяют исключить уровень Critical по кибербезопасности в её собственном Preparedness Framework. Это первый такой случай: все прежние модели, включая GPT-5.6 Sol, проходили уровнем ниже. Активности, не дотягивающие до усиленных требований, приостановлены, а мониторы теперь читают цепочку размышлений.
Databricks выложила свою математику расходов на кодинг-агентов: минус 50% токенов от тюнинга харнесса, а Opus 5 вышел дороже Opus 4.8
Соучредитель Databricks с коллегами описал четыре рычага снижения расходов на агентный кодинг: тюнинг харнесса и кеша дал почти минус 50% токенов, роутер между моделями минус 30% средней цены задачи. Самое неприятное в статье: Stripe отказалась выдавать разработчикам Opus 4.7, а Databricks увидела рост стоимости при переходе с Opus 4.8 на Opus 5.
Microsoft Flint: агент описывает график в пять строк, а компилятор собирает его в Vega-Lite, Plotly и Excel
Flint от Microsoft Research — промежуточный язык визуализации под MIT. Ты описываешь компактный спек с семантическими типами полей, а компилятор сам выводит масштабы, оси, отступы и раскладку. Один вход собирается в Vega-Lite, ECharts, Chart.js, Plotly и нативные графики Excel. В комплекте MCP-сервер: npx -y flint-chart-mcp, и агент рисует прямо из чата.
DeepSeek V4 Flash: №3 по интеллекту и последнее место по знаниям. Один чекпоинт, два индекса, 210 млн токенов
У Artificial Analysis DeepSeek V4 Flash 0731 — третье место по интеллекту из 101 модели и первое по цене кеш-хита. У BenchLM та же модель в категории «знания» стоит на 55-м месте из 55. Оба индекса корректны. Разбираем, почему так выходит, куда уходят деньги при прайсе $0,14 за миллион и какие циркулирующие бенчмарки относятся к апрельскому превью, а не к новому чекпоинту.
$ cat /dev/blog/updates
> Свежие заметки о программировании,
> DevOps и AI — прямо в мессенджер