Дата публикации
ai_products

Kimi K3 против Fable 5: как связка двух ИИ-моделей делает задачи дешевле и точнее

Что нового

Команда Kimi представила Kimi K3 — открытый крупный ИИ, который по качеству приближается к закрытой модели Fable 5, но стоит значительно дешевле. Главное не в том, что K3 «почти как Fable», а в том, как они работают в паре.

Авторы прогнали Kimi K3 и Fable 5 через ~1030 реальных «агентных» задач — когда модель не просто отвечает на один запрос, а ведёт длинную сессию: пишет код, правит баги, работает в терминале, решает алгоритмические задачи, разбирается в юридических кейсах.

Ключевые цифры:

  • 5 семейств задач, всего около 1030 заданий:
    • 460 задач на рефакторинг и фиксы багов в реальных репозиториях (SWE-стиль)
    • 89 длинных задач в терминале (безопасность, криптоанализ, реверс-инжиниринг, DevOps)
    • 100 алгоритмических задач в стиле LeetCode / AtCoder
    • 225 задач на реализацию кода на шести языках программирования
    • 120 юридических задач с оценкой юристами
  • При «маршрутизации» между двумя моделями (выбор, кому отдать конкретную задачу) удалось получить 93% точности.
  • По стоимости связка K3 + Fable оказалась до ~50 раз дешевле, чем использование только Fable 5 на длинных агентных сценариях в терминале.
  • Во всех пяти семействах задач Kimi K3 даёт ниже стоимость за задачу, чем Fable 5, при сопоставимой точности.
  • При идеальной (oracle) маршрутизации K3 выбирается для 72–96% задач — то есть большую часть работы можно отдавать именно ему, изредка подключая Fable.

По качеству K3 и Fable 5 очень близки:

  • SWE (правки в реальных репозиториях): K3 — 92,4%, Fable — 92,6%.
  • Разные типы задач внутри SWE показывают разную специализацию: K3 лучше в символической математике и инструментах разработчика, Fable — в веб-задачах и визуализации данных.
  • В мульти-языковом программировании Fable лучше справляется с Java, Python и C++, а K3 выравнивается по JavaScript и Rust.
  • В терминале на длинных задачах K3 закрывает кейсы, где Fable не справляется: хэш 7z, криптоанализ FEAL, поиск утёкших секретов, работа с живой уязвимостью, отладка runaway async-задач.

По стоимости и токенам картина ещё интереснее:

  • На SWE K3 «пашет» гораздо больше: в среднем 55 ходов и 1,3 млн токенов на задачу против 21 хода и 130 тыс. токенов у Fable.
  • В терминале всё наоборот: Fable уходит в длинные сессии — 64 хода и 1,5 млн токенов, иногда до таймаута.
  • Несмотря на то, что K3 часто читает в 10 раз больше токенов, за счёт кеширования промптов итоговая стоимость задач остаётся ниже, чем у Fable.

Итог эксперимента: одиночная модель уже не даёт оптимального соотношения цена/качество. Связка Kimi K3 + Fable 5 с маршрутизацией задач даёт более высокую точность, чем каждая по отдельности, при цене, близкой к стоимости только K3.

Как это работает

Исследование опирается на два ключевых механизма:

  1. Агентные циклы (agentic loops)
    Модели не просто получают один запрос, а ведут многошаговый диалог с задачей:

    • пишут и исправляют код,
    • запускают команды в терминале,
    • анализируют вывод,
    • корректируют стратегию.

    Каждая задача — это десятки ходов и сотни тысяч или миллионы токенов.

  2. Oracle-маршрутизация (oracle routing)
    Это способ измерить «теоретический потолок» качества и цены при наличии нескольких моделей:

    • каждую задачу прогоняют через обе модели,
    • смотрят, кто решил правильно,
    • среди правильных выбирают самое дешёвое решение.

    Так получают идеальный сценарий: если бы у вас была система, которая заранее знает, какая модель справится и сколько это будет стоить. На практике маршрутизатор так не может — он должен угадать модель до запуска. Но oracle даёт верхнюю границу того, чего можно добиться.

Внутри бенчмарка происходило следующее:

  • Для каждого семейства задач строили единый «каркас» тестирования.
  • Kimi K3 и Fable 5 запускали в одинаковых условиях.
  • Считали не только точность, но и:
    • количество ходов (turns) в диалоге,
    • количество токенов,
    • итоговую стоимость с учётом кеша промптов.

Ключевой технический фактор в пользу K3 — кеширование промптов:

  • При работе с большими агентными циклами многие части промпта повторяются.
  • Система кеширует уже обработанные фрагменты и не пересчитывает их каждый раз.
  • В результате даже если K3 читает и пишет в разы больше токенов, счёт за них растёт медленнее.

По поведению моделей видно, что они по-разному расходуют ресурсы:

  • K3 тратит больше шагов и токенов на задачи SWE, но при этом укладывается в меньший чек за счёт цены токена и кеша.
  • Fable «раздувает» длинные терминальные сессии — больше ходов, больше токенов, частые таймауты, и итоговая стоимость там резко растёт.

Oracle-маршрутизатор показывает распределение задач:

  • 72–96% задач разумно отдавать Kimi K3.
  • Остальные — это «длинный хвост» сложных задач, где Fable даёт выигрыш по качеству.

На графиках (в оригинальном исследовании):

  • K3 на диаграмме «стоимость vs точность» во всех пяти семействах задач находится левее Fable — то есть дешевле при сопоставимой или лучшей точности.
  • Вертикальные разрывы между точками показывают, кто выигрывает по качеству в конкретном семействе.

Что это значит для вас

Если вы строите продукты или внутренние инструменты на ИИ, главный вывод простой: не выбирайте одну модель «на все случаи».

Когда использовать Kimi K3

K3 особенно интересен, если вы:

  • Запускаете много агентных задач в фоне: автотесты, массовые багфиксы, анализ репозиториев.
  • Держите ботов-операторов терминала: DevOps-ассистенты, скрипты для безопасности, криптоанализ, реверс-инжиниринг.
  • Строите юридические или полуправовые ассистенты, где важна высокая точность при контролируемой стоимости.
  • Делаете мульти-языковые разработки, где важны JavaScript и Rust.

В этих сценариях K3 даёт хорошее качество и заметно более низкую стоимость за задачу, особенно при большом количестве запросов.

Минусы:

  • На задачах SWE K3 требует больше ходов и токенов, чем Fable. Это значит дольше время ответа. Если вам нужна реакция за пару секунд — это может быть критично.
  • В мульти-языковом программировании K3 не всегда лучший выбор для Java, Python и C++ — там Fable показывает себя лучше.

Когда подключать Fable 5

Fable имеет смысл использовать точечно:

  • Как «премиум» модель для задач, где ошибка особенно дорога: сложные баги, критичные бизнес-решения, чувствительные юридические кейсы.
  • Для задач, где требуется широкий охват языков программирования с акцентом на Java, Python и C++.
  • Там, где важна скорость ответа при относительно коротких агентных циклах.

При этом Fable заметно дороже. На длинных терминальных задачах связка «только Fable» может стоить до 50 раз больше, чем сценарий с маршрутизацией и K3.

Зачем вам маршрутизатор

Если вы сейчас строите продукт на одной модели, вы фактически переплачиваете или за качество, или за токены.

Что даёт маршрутизация:

  • Вы отправляете типовые задачи (большинство трафика) в Kimi K3.
  • Редкие и особенно сложные — в Fable 5.
  • В сумме получаете:
    • качество выше, чем у любой из моделей по отдельности,
    • счёт ближе к цене K3, а не к цене Fable.

Практически это означает:

  • Для внутренних инструментов в компании вы можете резко снизить бюджет на ИИ, не потеряв точность.
  • Для SaaS-продуктов на ИИ вы можете удерживать цену для клиентов и при этом улучшать качество за счёт правильной маршрутизации.

Доступность:

  • В тексте исследования есть отсылка к стоимости K3 на платформе Fireworks (K3 может быть до 50 раз дешевле Fable на длинных сценариях).
  • Если вы работаете из России, доступ к этим сервисам может потребовать VPN и юридической проверки использования зарубежных ИИ-платформ.

Место на рынке

Kimi K3 и Fable 5 — это не классическая пара «младшая и старшая версия». Они ведут себя как два специализированных инструмента с разной ценой и разными сильными сторонами.

По результатам тестов:

  • Качество:
    • SWE: K3 — 92,4%, Fable — 92,6% (практически паритет).
    • Терминал: K3 решает задачи, которые Fable вообще не закрывает (безопасность, крипто, утечки секретов, живые уязвимости).
    • Мульти-языковое программирование: Fable лучше в Java/Python/C++, K3 не проигрывает в JavaScript и Rust.
    • Юридические задачи: K3 показывает преимущество по точности.
  • Стоимость:
    • Во всех пяти семействах задач точка K3 на графике «стоимость vs точность» находится левее Fable — то есть K3 дешевле при сопоставимой или лучшей точности.
    • На длинных терминальных задачах связка K3 + Fable с маршрутизацией даёт до ~50 раз меньшую стоимость, чем использование одного Fable.

Главный рыночный вывод:

  • Ориентироваться на одного поставщика ИИ-модели уже невыгодно.
  • Лучшие результаты даёт микс моделей с умной маршрутизацией по типам задач.
  • Kimi K3 в этой схеме — базовый рабочий «двигатель», который закрывает 72–96% задач по данным oracle-маршрутизатора.
  • Fable 5 — дорогой, но точный инструмент для сложного «длинного хвоста» задач.

Если вы строите ИИ-инфраструктуру на годы вперёд, стоит планировать архитектуру не под одну «главную» модель, а под пул моделей с маршрутизатором поверх — и Kimi K3 с Fable 5 показывают, что такой подход уже даёт измеримый выигрыш по деньгам и качеству.


Читайте также