- Дата публикации
Kimi K3 против Fable 5: как связка двух ИИ-моделей делает задачи дешевле и точнее
Что нового
Команда Kimi представила Kimi K3 — открытый крупный ИИ, который по качеству приближается к закрытой модели Fable 5, но стоит значительно дешевле. Главное не в том, что K3 «почти как Fable», а в том, как они работают в паре.
Авторы прогнали Kimi K3 и Fable 5 через ~1030 реальных «агентных» задач — когда модель не просто отвечает на один запрос, а ведёт длинную сессию: пишет код, правит баги, работает в терминале, решает алгоритмические задачи, разбирается в юридических кейсах.
Ключевые цифры:
- 5 семейств задач, всего около 1030 заданий:
- 460 задач на рефакторинг и фиксы багов в реальных репозиториях (SWE-стиль)
- 89 длинных задач в терминале (безопасность, криптоанализ, реверс-инжиниринг, DevOps)
- 100 алгоритмических задач в стиле LeetCode / AtCoder
- 225 задач на реализацию кода на шести языках программирования
- 120 юридических задач с оценкой юристами
- При «маршрутизации» между двумя моделями (выбор, кому отдать конкретную задачу) удалось получить 93% точности.
- По стоимости связка K3 + Fable оказалась до ~50 раз дешевле, чем использование только Fable 5 на длинных агентных сценариях в терминале.
- Во всех пяти семействах задач Kimi K3 даёт ниже стоимость за задачу, чем Fable 5, при сопоставимой точности.
- При идеальной (oracle) маршрутизации K3 выбирается для 72–96% задач — то есть большую часть работы можно отдавать именно ему, изредка подключая Fable.
По качеству K3 и Fable 5 очень близки:
- SWE (правки в реальных репозиториях): K3 — 92,4%, Fable — 92,6%.
- Разные типы задач внутри SWE показывают разную специализацию: K3 лучше в символической математике и инструментах разработчика, Fable — в веб-задачах и визуализации данных.
- В мульти-языковом программировании Fable лучше справляется с Java, Python и C++, а K3 выравнивается по JavaScript и Rust.
- В терминале на длинных задачах K3 закрывает кейсы, где Fable не справляется: хэш 7z, криптоанализ FEAL, поиск утёкших секретов, работа с живой уязвимостью, отладка runaway async-задач.
По стоимости и токенам картина ещё интереснее:
- На SWE K3 «пашет» гораздо больше: в среднем 55 ходов и 1,3 млн токенов на задачу против 21 хода и 130 тыс. токенов у Fable.
- В терминале всё наоборот: Fable уходит в длинные сессии — 64 хода и 1,5 млн токенов, иногда до таймаута.
- Несмотря на то, что K3 часто читает в 10 раз больше токенов, за счёт кеширования промптов итоговая стоимость задач остаётся ниже, чем у Fable.
Итог эксперимента: одиночная модель уже не даёт оптимального соотношения цена/качество. Связка Kimi K3 + Fable 5 с маршрутизацией задач даёт более высокую точность, чем каждая по отдельности, при цене, близкой к стоимости только K3.
Как это работает
Исследование опирается на два ключевых механизма:
-
Агентные циклы (agentic loops)
Модели не просто получают один запрос, а ведут многошаговый диалог с задачей:- пишут и исправляют код,
- запускают команды в терминале,
- анализируют вывод,
- корректируют стратегию.
Каждая задача — это десятки ходов и сотни тысяч или миллионы токенов.
-
Oracle-маршрутизация (oracle routing)
Это способ измерить «теоретический потолок» качества и цены при наличии нескольких моделей:- каждую задачу прогоняют через обе модели,
- смотрят, кто решил правильно,
- среди правильных выбирают самое дешёвое решение.
Так получают идеальный сценарий: если бы у вас была система, которая заранее знает, какая модель справится и сколько это будет стоить. На практике маршрутизатор так не может — он должен угадать модель до запуска. Но oracle даёт верхнюю границу того, чего можно добиться.
Внутри бенчмарка происходило следующее:
- Для каждого семейства задач строили единый «каркас» тестирования.
- Kimi K3 и Fable 5 запускали в одинаковых условиях.
- Считали не только точность, но и:
- количество ходов (turns) в диалоге,
- количество токенов,
- итоговую стоимость с учётом кеша промптов.
Ключевой технический фактор в пользу K3 — кеширование промптов:
- При работе с большими агентными циклами многие части промпта повторяются.
- Система кеширует уже обработанные фрагменты и не пересчитывает их каждый раз.
- В результате даже если K3 читает и пишет в разы больше токенов, счёт за них растёт медленнее.
По поведению моделей видно, что они по-разному расходуют ресурсы:
- K3 тратит больше шагов и токенов на задачи SWE, но при этом укладывается в меньший чек за счёт цены токена и кеша.
- Fable «раздувает» длинные терминальные сессии — больше ходов, больше токенов, частые таймауты, и итоговая стоимость там резко растёт.
Oracle-маршрутизатор показывает распределение задач:
- 72–96% задач разумно отдавать Kimi K3.
- Остальные — это «длинный хвост» сложных задач, где Fable даёт выигрыш по качеству.
На графиках (в оригинальном исследовании):
- K3 на диаграмме «стоимость vs точность» во всех пяти семействах задач находится левее Fable — то есть дешевле при сопоставимой или лучшей точности.
- Вертикальные разрывы между точками показывают, кто выигрывает по качеству в конкретном семействе.
Что это значит для вас
Если вы строите продукты или внутренние инструменты на ИИ, главный вывод простой: не выбирайте одну модель «на все случаи».
Когда использовать Kimi K3
K3 особенно интересен, если вы:
- Запускаете много агентных задач в фоне: автотесты, массовые багфиксы, анализ репозиториев.
- Держите ботов-операторов терминала: DevOps-ассистенты, скрипты для безопасности, криптоанализ, реверс-инжиниринг.
- Строите юридические или полуправовые ассистенты, где важна высокая точность при контролируемой стоимости.
- Делаете мульти-языковые разработки, где важны JavaScript и Rust.
В этих сценариях K3 даёт хорошее качество и заметно более низкую стоимость за задачу, особенно при большом количестве запросов.
Минусы:
- На задачах SWE K3 требует больше ходов и токенов, чем Fable. Это значит дольше время ответа. Если вам нужна реакция за пару секунд — это может быть критично.
- В мульти-языковом программировании K3 не всегда лучший выбор для Java, Python и C++ — там Fable показывает себя лучше.
Когда подключать Fable 5
Fable имеет смысл использовать точечно:
- Как «премиум» модель для задач, где ошибка особенно дорога: сложные баги, критичные бизнес-решения, чувствительные юридические кейсы.
- Для задач, где требуется широкий охват языков программирования с акцентом на Java, Python и C++.
- Там, где важна скорость ответа при относительно коротких агентных циклах.
При этом Fable заметно дороже. На длинных терминальных задачах связка «только Fable» может стоить до 50 раз больше, чем сценарий с маршрутизацией и K3.
Зачем вам маршрутизатор
Если вы сейчас строите продукт на одной модели, вы фактически переплачиваете или за качество, или за токены.
Что даёт маршрутизация:
- Вы отправляете типовые задачи (большинство трафика) в Kimi K3.
- Редкие и особенно сложные — в Fable 5.
- В сумме получаете:
- качество выше, чем у любой из моделей по отдельности,
- счёт ближе к цене K3, а не к цене Fable.
Практически это означает:
- Для внутренних инструментов в компании вы можете резко снизить бюджет на ИИ, не потеряв точность.
- Для SaaS-продуктов на ИИ вы можете удерживать цену для клиентов и при этом улучшать качество за счёт правильной маршрутизации.
Доступность:
- В тексте исследования есть отсылка к стоимости K3 на платформе Fireworks (K3 может быть до 50 раз дешевле Fable на длинных сценариях).
- Если вы работаете из России, доступ к этим сервисам может потребовать VPN и юридической проверки использования зарубежных ИИ-платформ.
Место на рынке
Kimi K3 и Fable 5 — это не классическая пара «младшая и старшая версия». Они ведут себя как два специализированных инструмента с разной ценой и разными сильными сторонами.
По результатам тестов:
- Качество:
- SWE: K3 — 92,4%, Fable — 92,6% (практически паритет).
- Терминал: K3 решает задачи, которые Fable вообще не закрывает (безопасность, крипто, утечки секретов, живые уязвимости).
- Мульти-языковое программирование: Fable лучше в Java/Python/C++, K3 не проигрывает в JavaScript и Rust.
- Юридические задачи: K3 показывает преимущество по точности.
- Стоимость:
- Во всех пяти семействах задач точка K3 на графике «стоимость vs точность» находится левее Fable — то есть K3 дешевле при сопоставимой или лучшей точности.
- На длинных терминальных задачах связка K3 + Fable с маршрутизацией даёт до ~50 раз меньшую стоимость, чем использование одного Fable.
Главный рыночный вывод:
- Ориентироваться на одного поставщика ИИ-модели уже невыгодно.
- Лучшие результаты даёт микс моделей с умной маршрутизацией по типам задач.
- Kimi K3 в этой схеме — базовый рабочий «двигатель», который закрывает 72–96% задач по данным oracle-маршрутизатора.
- Fable 5 — дорогой, но точный инструмент для сложного «длинного хвоста» задач.
Если вы строите ИИ-инфраструктуру на годы вперёд, стоит планировать архитектуру не под одну «главную» модель, а под пул моделей с маршрутизатором поверх — и Kimi K3 с Fable 5 показывают, что такой подход уже даёт измеримый выигрыш по деньгам и качеству.