Google выпустила три Gemini и снова не выпустила 3.5 Pro. Зато уже учит Gemini 4
Google 21 июля выкатила сразу три модели Gemini и не выпустила ту одну, которую все ждали. В релиз пошли 3.6 Flash, 3.5 Flash-Lite и закрытая 3.5 Flash Cyber. А флагман Gemini 3.5 Pro, который обещали ещё в июне и переносили в третий раз, опять сдвинули: теперь он «в тестировании с партнёрами». В том же посте, где Google признаёт задержку Pro, она объявляет, что уже начала обучать Gemini 4. Флагман, за которым все охотятся, рискуют просто перепрыгнуть.
TL;DR: Gemini 3.6 Flash подешевел на выходе ($1.50/$7.50 против $9.00 у прошлого Flash), стал экономнее по токенам и обновил бенчмарки. Flash-Lite ($0.30/$2.50) целит в скорость (350 tok/s). Flash Cyber ищет уязвимости, но его отдают только правительствам. Gemini 3.5 Pro отложили в третий раз, зато Google уже запустила «самый амбициозный на сегодня» pre-training прогон для Gemini 4. Главный подвох: дешевле не только за токен, но и потому, что модель по замерам генерит на 17% меньше токенов, это первый случай, когда «наша модель меньше болтает» продают как фичу.
Что вышло и почём
Главный релиз это gemini-3.6-flash, рабочая лошадка линейки. Стоит $1.50 за миллион входных токенов и $7.50 за выходные, контекст 1 миллион токенов, максимум выхода 64 тысячи, knowledge cutoff март 2026. Прошлый 3.5 Flash стоил $1.50/$9.00, то есть выход подешевел. Кэширование контекста считается по $0.15 за миллион плюс $1.00 за миллион в час на хранение. Дефолтный уровень «размышления» опустили с high до medium.
Второй релиз это gemini-3.5-flash-lite за $0.30/$2.50, самая быстрая модель линейки по заявлению Google (350 output tokens в секунду). У неё есть неприятный нюанс: на Standard tier для неё недоступно кэширование контекста, так что для потоковых пайплайнов с повторяющимся префиксом главный рычаг экономии отключён.
Третий это gemini-3.5-flash-cyber, дообученная на кибербезопасность модель, которую в публичный API не пустят. Её раздают только правительствам и trusted partners внутри агента CodeMender. Про неё подробнее ниже.
Доступ к 3.6 Flash уже есть в Google AI Studio, Android Studio, Google Antigravity и GitHub Copilot (там модель раскатывают под именем «Gemini 3.6 Flash Preview», админ Enterprise должен включить политику). Простейший вызов через API выглядит так:
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.6-flash:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-X POST \
-d '{
"contents": [{"parts": [{"text": "Объясни, как работает B-tree индекс, кратко."}]}],
"generationConfig": {"thinkingConfig": {"thinkingLevel": "low"}}
}'
Насколько 3.6 Flash реально лучше
По вендорским замерам Google 3.6 Flash заметно обгоняет прошлый 3.5 Flash, но независимых кросс-вендорных сравнений на день релиза почти нет. По цифрам самой Google на DeepSWE от Datacurve модель даёт 49% против 37% у 3.5 Flash, на MLE Bench 63.9% против 49.7%, на OSWorld для computer use 83.0% против 78.4%. Все эти числа вендорские, то есть репортит их сам Google на своих прогонах, и относиться к ним надо соответственно.
Единственное независимое, что есть на сегодня, это Artificial Analysis: их Intelligence Index v4.1 для 3.6 Flash равен 50, а на прогон индекса модель тратит около 59 миллионов выходных токенов при рыночном среднем около 63 миллионов. Это косвенно подтверждает тезис Google про экономность, но не сам процент «17%». Прямых таблиц «3.6 Flash против GPT-5.6 Luna или Claude Fable 5 на кодинге» с датами найти не удалось, так что если увидите такое сравнение, проверяйте, кто его считал.
Тезис про эффективность Google формулирует так: «According to the Artificial Analysis Index, it reduces output token usage by 17% compared to 3.5 Flash, and in some benchmarks like DeepSWE by Datacurve, we observe up to 65%, all at a lower cost per output token». То есть вы платите меньше за токен и при этом тратите меньше токенов. Модель, которая меньше болтает, как маркетинговый аргумент, это новый жанр.
Зачем Google прячет модель, которая ищет уязвимости
Flash Cyber это специализированная модель для поиска, проверки и починки уязвимостей, и Google сознательно не пускает её в открытый доступ из-за двойного назначения. Она работает внутри агента CodeMender по трём фазам: сканирует код на баги, собирает эксплойт в песочнице для проверки, готовит патч на ревью разработчику. Ставка на дешевизну за токен: можно запускать много вызовов и прочёсывать большие кодовые базы вместо одного дорогого прогона большой модели.
Ключевая цифра из блога DeepMind: на движке V8 браузера Chrome Flash Cyber нашёл 55 уникальных подтверждённых проблем против 47 у обычного 3.5 Flash и 36 у Claude Opus 4.6, причём 10 из них не нашли ни та, ни другая модель. Формулировка про ограничение доступа прямая: «Given the dual-use nature of this technology... The model will be exclusively available to governments and trusted partners via CodeMender».
Спор про двойное назначение простой. За ограничение: тот же движок ищет дыры и для защиты, и для атаки, гейтинг даёт защитникам фору. Против: «governments and trusted partners» само по себе спорно, потому что государства бывают и наступательными акторами, а именно open-source мейнтейнеры, которым инструмент нужнее всего, остаются за бортом. И закрытость не мешает другим лабам обучить аналог. Тем более что на той же неделе исследователь Searchlight Cyber нашёл RCE в ядре WordPress с помощью GPT-5.6 за $25: специализированная кибер-модель уже не единственный способ.
Что происходит с Gemini 3.5 Pro
Флагман отложили в третий раз, и это уже не случайность, а тренд. Таймлайн такой: Pro анонсировали на Google I/O весной, последнее обновление Pro-линейки было в феврале 2026, обещали в июне, сдвинули на июль, циркулировала дата 17 июля, прошла без релиза. 16 июля Bloomberg сообщила, что запуск отложен, потому что «tech falls short of internal goals», а июньский апдейт тренировочных данных под кодинг дал разочаровывающие результаты. В тот день акции Alphabet упали на 4.4%.
Точная фраза Google на 21 июля: «Gemini 3.5 Pro is currently testing with partners and we plan to make it broadly available as soon as it's ready». И тут же, в том же абзаце: «We have started our most ambitious pre-training run yet, for Gemini 4, and are excited by the progress». Пока Pro буксует, конкуренты ушли вперёд: OpenAI выпустила GPT-5.6, Anthropic развернула Opus 4.8, Sonnet 5 и Fable 5. Реакция на HN была едкой: «Google somehow managed to snatch defeat from the jaws of success».
Подводные камни
Thinking-токены это обычные выходные токены по $7.50. Отдельной цены за «размышления» Google не публикует, reasoning тарифицируется как вывод. А дефолт для 3.6 Flash это thinking_level: medium, то есть модель по умолчанию думает и жжёт выходные токены. На объёмах агентных задач это заметная статья расхода, для дешёвых сценариев ставьте minimal или low.
Потолок вывода 64 тысячи токенов. Контекст миллион, но за один ответ модель не выдаст больше 64k. Большой рефакторинг или генерацию по всей кодовой базе придётся чанкать.
Баг с квотой в Antigravity. На официальном форуме Google в середине июля висела пачка тредов про то, что квота Gemini в Antigravity обнуляется мгновенно без единого сгенерированного ответа. Причина по разбору в переходе на двойной лимит (250 юнитов sprint с ресетом раз в 5 часов плюс недельный хард-кап), а опция AI Credits жжёт квоту быстрее обычных промптов. Практический риск: включив 3.6 Flash в Antigravity, можно за один прогон обнулить недельную квоту.
Из России напрямую не работает. Google AI Studio и Gemini API по умолчанию недоступны из РФ по гео-ограничению Google. Нужен иностранный аккаунт, биллинг и не-российский IP, иначе ключ не выдаётся, а запросы блокируются. Cutoff март 2026 тоже стоит держать в голове: всё свежее модель не знает без веб-грудинга, а он платный сверх 5000 запросов в месяц ($14 за 1000).
Альтернативы с ценами
- GPT-5.6 Luna — $1/$6, прямой ценовой конкурент. Дешевле на входе, но дороже на выходе, cost-optimized тир семейства GPT-5.6.
- Claude Haiku 4.5 — $1/$5, дешевле 3.6 Flash по обеим осям, сильный tool-use и низкая латентность, но контекст меньше миллиона.
- DeepSeek V4 Flash — $0.14/$0.28, радикально дешевле всех, open-weight, для bulk-обработки, где качество фронтира не критично.
- Qwen3 Max — $0.78/$3.90 (кодинг-вариант Coder Plus $0.65/$3.25), дешёвый open-flagship от Alibaba, конкурирует с Flash-классом по цене.
Вердикт
Берите 3.6 Flash, если вам нужен быстрый мультимодальный воркхорс с миллионным контекстом и computer use под задачи среднего уровня: чат-боты, извлечение данных, агентные пайплайны, где топ-ризонинг не обязателен. По цене за токен модель приятная, а экономность по токенам это реальный, а не выдуманный плюс. Не ждите от неё уровня Opus или Sol на сложном кодинге, для этого есть флагманы, а 3.5 Pro пока в тумане. И если вы на Antigravity, до фикса бага с квотой держите под рукой запасной ключ. Отдельно стоит следить за судьбой 3.5 Pro: если Google действительно перепрыгнет его ради Gemini 4, это будет громкий сигнал, что даже у бигтеха флагман может не взлететь.
Как попробовать
- Получите ключ в Google AI Studio (из РФ понадобится иностранный аккаунт и IP), экспортируйте его в
GEMINI_API_KEY. - Прогоните curl-запрос из этого поста с
thinkingLevel: low, чтобы не переплачивать за размышления на простой задаче. - Для агентной работы поставьте
thinking_level: mediumтолько там, где нужен многошаговый разбор, и следите за выходными токенами в дашборде. - В Antigravity выберите «Gemini 3.6 Flash» в пикере моделей, но сначала проверьте остаток квоты, чтобы не обнулить её багом.
- Сравните на своей реальной задаче 3.6 Flash с GPT-5.6 Luna и DeepSeek V4 Flash по цене за результат, а не за токен: у самой дешёвой по токенам модели может уйти больше вызовов.