Дата публикации
ai_products

Gemini 3.6 Flash и Flash‑Lite: Google делает ИИ дешевле и быстрее, но не самым умным

Что нового

Google представила три новых модели семейства Gemini:

  1. Gemini 3.6 Flash

    • Акцент на коде и работе с базами знаний.
    • Оптимизация под низкую задержку и массовые запросы.
    • Цена: $1,50 за 1 млн входных токенов и $7,50 за 1 млн выходных токенов.
    • Быстрее прошлых Flash‑версий, при этом дешевле на некоторых бенчмарках, чем Gemini 3.5 Flash.
  2. Gemini 3.5 Flash‑Lite

    • Самая дешёвая модель в линейке Flash.
    • Цена: $0,30 за 1 млн входных токенов и $2,50 за 1 млн выходных токенов.
    • Скорость генерации: около 350 выходных токенов в секунду.
    • Нацелена на сценарии, где важны массовые запросы и низкая стоимость, а не максимальный интеллект.
    • По сравнению с китайской Kimi K3 ($3 за 1 млн входных и $15 за 1 млн выходных токенов) Flash‑Lite кратно дешевле.
    • По сравнению с условной линейкой GPT‑5.6 от OpenAI ($1–5 за 1 млн входных и $6–30 за 1 млн выходных токенов) Flash‑Lite также заметно дешевле.
  3. Gemini 3.6 Flash Cyber

    • Специализированная кибербезопасностная модель.
    • Работает в паре с CodeMender — агентом Google для поиска, исправления и предотвращения уязвимостей в коде.
    • Задача: автоматизировать часть работы security‑команд и встроиться в цикл разработки ПО.

Отдельно Google готовит Gemini 3.5 Pro — более мощную модель, которая пока проходит тестирование и выйдет позже.

На фоне этого релиза другие игроки тоже давят на цену: Alibaba и Moonshot объявили о своих высокопроизводительных, но дешёвых моделях, а китайская Kimi K3 и Qwen 3.8 Max от Alibaba показывают, что Китай догоняет США по качеству ИИ при агрессивной ценовой политике.

Как это работает

Google явно делает ставку не только на «умность» модели, но и на инфраструктуру для дешёвого и массового инференса:

  • Flash‑линейка архитектурно заточена под:
    • высокую скорость генерации (низкая латентность);
    • обработку большого числа запросов параллельно;
    • снижение стоимости выходных токенов, которые в агентных сценариях стоят дороже, чем входные.

Эксперты в материале подчёркивают именно это:

  • Айхам Бушер (Cornell University): в агентных системах промпт может быть коротким, а модель генерирует много текста сама.
    Поэтому выходные токены критичнее входных. Google снижает именно их стоимость в Flash‑линейке.

  • Сид Наг (Tekonyx): одна из главных статей расходов для крупных компаний — это обучение и инференс.
    Если Google уменьшает задержку и стоимость токенов в Gemini 3.6 Flash, это даёт заметную экономию при больших развёртываниях.

С технической точки зрения важно не только то, «насколько умна» модель, но и как она ведёт себя в продакшене:

  • Высокий throughput инференса — возможность обслуживать много запросов одновременно без резкого роста стоимости.
  • Интеграция с агентами (например, CodeMender) — модель не просто отвечает на вопросы, а инициирует действия: ищет уязвимости, предлагает патчи, автоматизирует проверки.

Gemini 3.6 Flash Cyber — пример такой архитектуры: это оркестратор для задач безопасности, который может:

  • анализировать код и конфигурации,
  • находить потенциальные уязвимости,
  • предлагать (и потенциально применять) исправления.

При этом эксперты честно говорят: по интеллекту новые Flash‑модели не догоняют топовые закрытые модели от OpenAI и Anthropic. Google сейчас инвестирует в инфраструктуру и стоимость, а не только в максимальные бенчмарки по «уму».

Что это значит для вас

Где модели реально полезны

1. Gemini 3.5 Flash‑Lite

Подходит, если вам нужно:

  • Масштабировать ИИ‑сервисы с огромным количеством запросов:
    чат‑боты поддержки, ассистенты для маркетинга, генерация описаний товаров, интерактивные FAQ.
  • Быстро генерировать много текста:
    черновики постов, письма, внутренние отчёты, документацию.
  • Экономить бюджет на ИИ:
    при $0,30 / $2,50 за 1 млн входных/выходных токенов модель выгодна для стартапов и SMB, где каждый доллар на облако имеет значение.

Где не стоит полагаться только на Flash‑Lite:

  • сложные научные и юридические задачи;
  • критичные бизнес‑решения, где ошибка модели может стоить дорого;
  • задачи, где важна максимальная точность рассуждений и глубокий анализ.

2. Gemini 3.6 Flash

Эта версия интересна, если вы:

  • строите внутренних код‑ассистентов для разработчиков;
  • разворачиваете системы поиска по корпоративным знаниям (документы, базы знаний, вики);
  • хотите ускорить уже существующие ИИ‑сервисы, не взлетая по бюджету.

За счёт фокуса на коде и знаниях 3.6 Flash логично использовать для:

  • автодополнения и рефакторинга кода;
  • объяснения и документирования существующих систем;
  • построения чат‑поиска по базе внутренних документов.

При этом по цене $1,50 / $7,50 за 1 млн входных/выходных токенов 3.6 Flash всё ещё дороже некоторых конкурентов по выходным токенам. Если у вас сценарий с очень большим объёмом генерации, бюджет лучше считать заранее.

3. Gemini 3.6 Flash Cyber

Эта модель интересна компаниям с развитой инженерной культурой и требованиями к безопасности:

  • интеграция в CI/CD‑пайплайны для автоматического поиска уязвимостей в коде;
  • помощь security‑командам как «force multiplier»: модель берёт на себя рутину, люди занимаются сложными кейсами;
  • автоматизированные рекомендации по патчам и исправлениям.

Но есть важные ограничения:

  • Автономное исправление кода без человеческой проверки — риск.
    TJ Marlin (Guardrail Technologies) прямо говорит: нужны чёткие механизмы контроля и обратной связи.
  • Все риски, которые уже известны для ИИ‑систем (манипуляции промптами, ошибки, ложные срабатывания), никуда не делись.
    Они также распространяются на агентную систему для поиска уязвимостей.

Если вы строите процессы безопасности, разумнее использовать Cyber‑модель как инструмент для команды, а не как полностью автономного «ремонтника» кода.

Доступность из России

Google традиционно ограничивает доступ к своим ИИ‑продуктам в ряде регионов.
Для российских пользователей и компаний доступ к Gemini и связанным API может требовать VPN и юридическую проверку условий использования.

Если вы работаете на глобальный рынок через зарубежную инфраструктуру (например, через европейский или американский облачный аккаунт), доступ упростится. Для локальных российских проектов стоит заранее продумать:

  • где будет размещаться инфраструктура;
  • как вы будете оплачивать использование API;
  • какие юридические риски вы готовы взять на себя.

Место на рынке

Новые Flash‑модели Google — это ставка на скорость и цену, а не на звание «самого умного ИИ».

По ключевым параметрам:

  • Gemini 3.5 Flash‑Lite:

    • $0,30 / $2,50 за 1 млн входных/выходных токенов;
    • около 350 токенов в секунду;
    • дешевле, чем:
      • Kimi K3 (Kimi: $3 / $15),
      • линейка GPT‑5.6 (OpenAI: $1–5 / $6–30).
    • Логичный выбор для массовых сценариев, где критична цена.
  • Gemini 3.6 Flash:

    • $1,50 / $7,50 за 1 млн входных/выходных токенов;
    • дороже по выходным токенам, чем, например, Grok 4.5 от SpaceXAI ($2 / $6).
    • При коротких промптах и длинных ответах это может сделать Grok 4.5 экономичнее по итоговому чеку.

Эксперты оценивают ситуацию так:

  • Скорость:
    Айхам Бушер отмечает, что Google добилась высокой скорости — «значительно впереди всех закрытых фронтир‑моделей», конкурировать с этим могут только некоторые open‑source решения.

  • Интеллект:
    По уровню «ума» новые Flash‑модели не дотягивают до топовых релизов OpenAI и Anthropic.
    Но Google целенаправленно работает над инфраструктурой и стоимостью инференса, а не только над максимумом в бенчмарках.

  • Стратегия:
    Ставка Google — на быстрые и дешёвые модели, которые покрывают огромный пласт задач, где «самый умный» ИИ не нужен.
    При этом эксперты подчёркивают: Google всё равно нужен фронтир‑уровень модели, которая будет конкурировать по интеллекту.
    Иначе компания теряет позицию в гонке за передовые способности ИИ.

На горизонте следующего года ожидают новую версию Gemini 3.6. Если она окажется умнее текущей Anthropic Fable, при этом сохранит скорость и более низкую цену, интерес со стороны крупных компаний будет высоким.
Многие задачи в бизнесе не требуют «максимального интеллекта» — им достаточно «достаточно умного, но дешёвого и быстрого» ИИ.

Для вас вывод простой:

  • если вы строите массовый продукт с ИИ‑функциями и считаете каждый доллар за токены — Gemini 3.5 Flash‑Lite и 3.6 Flash стоит включить в список кандидатов;
  • если вам нужна максимальная точность и глубина рассуждений, а бюджет вторичен — придётся смотреть на топовые релизы OpenAI и Anthropic;
  • если вы развиваете направление кибербезопасности, Cyber‑модель может ускорить работу команды, но не заменит людей и требует аккуратной интеграции с жёсткими проверками.

Читайте также