Kimi K3: лидерство в агентных задачах ценой скорости и бюджета

Hacker News · оригинал

Материал подготовлен автоматизированной редакционной системой. Факты можно сверить по указанному первоисточнику.

Новая модель Kimi K3 от Moonshot AI заняла второе место в бенчмарке AA-Briefcase, уступив лишь Claude Fable 5. При этом стоимость выполнения одной задачи для Kimi K3 в десять раз выше, а среднее время обработки составляет почти час.

Ценность: Результаты демонстрируют новый этап развития агентных ИИ-систем: модели начинают справляться со сложными многошаговыми задачами на уровне топ-конкурентов, но их практическое внедрение сдерживается экстремально высокими операционными расходами и длительным временем отклика.

Компания Moonshot AI представила Kimi K3 — языковую модель с объемом параметров 2,8 триллиона. По данным Artificial Analysis, новый релиз показал результат 57 баллов в Индексе интеллекта, что сопоставимо с показателями таких систем, как Opus 4.8 и GPT-5.5. Однако ключевым достижением модели стало ее выступление в специализированном тесте AA-Briefcase, разработанном для оценки агентной работы с знаниями.

В этом бенчмарке Kimi K3 набрала 1543 очка по шкале Elo, что позволило ей занять второе место среди всех протестированных моделей. Единственной системой, превзошедшей ее, стала Claude Fable 5 с результатом 1574 очка. Для сравнения, предыдущая версия Kimi K2.6 набрала лишь 816 очков, что свидетельствует о колоссальном прогрессе в +727 баллов за одно поколение. Модель также обошла GPT-5.6 Sol (1501 очко), Claude Sonnet 5 (1388 очков) и Claude Opus 4.8 (1347 очков).

Тест AA-Briefcase использует закрытый набор данных с реалистичными задачами, требующими работы с тысячами сложных входных файлов. От модели требуется создать конкретные артефакты: таблицы, презентации или макеты интерфейсов. Оценка строится на трех критериях: корректность, аналитическое качество и качество подачи. Kimi K3 продемонстрировала сильную аналитику, набрав 1754 очка в соответствующей категории, что почти идентично результату Fable 5 (1744 очка).

Однако у модели есть заметное слабое место — качество презентации. Показатель Presentation Elo для Kimi K3 составил 1471, что ниже результатов GPT-5.6 Sol (1660) и даже Claude Opus 4.8 (1492). Это указывает на то, что хотя модель отлично справляется с логикой и вычислениями, она уступает конкурентам в способности оформить результат в эстетически привлекательный или удобный для восприятия вид.

Наиболее критичным фактором для потенциальных пользователей стала стоимость. Средняя цена выполнения одной задачи для Kimi K3 составляет $10,57, что делает ее одной из самых дорогих моделей на рынке. Этот показатель в десять раз выше, чем у многих конкурентов. Высокая стоимость обусловлена ценообразованием за токены ($3 за 1 млн входных и $15 за 1 млн выходных), а также огромным количеством итераций: модель совершает в среднем 83 хода на задачу против 67 у Fable 5 и 50 у GPT-5.6 Sol.

Ситуация усугубляется временем выполнения. Kimi K3 тратит в среднем 56,4 минуты на одну задачу в AA-Briefcase. Это один из самых высоких показателей среди всех тестированных систем: время в 2,5 раза больше, чем у Claude Fable 5, и почти в четыре раза выше, чем у Grok 4.5. Причины кроются в использовании 120 тыс. выходных токенов на задачу (против 42 тыс. у предыдущей версии) и сниженной скорости обработки через собственный API разработчика.

Таким образом, Kimi K3 представляет собой мощный инструмент для сложных аналитических задач, где важна глубина рассуждений, но не скорость или бюджет. Для массового внедрения в бизнес-процессы такие параметры пока остаются серьезным барьером, заставляя компании выбирать между качеством агентного поведения и экономическими ограничениями.