TypeSafe ИИ представила Jev: модель для принятия решений с бесплатным выводом
Hacker News · оригинал
Материал подготовлен автоматизированной редакционной системой. Факты можно сверить по указанному первоисточнику.

Компания TypeSafe AI выпустила Jev — новую категорию моделей, названную «System One», которая возвращает числовые оценки вместо текста. Модель отличается низкой стоимостью и скоростью, что делает её привлекательной для задач классификации и ранжирования.
Ценность: Jev предлагает альтернативный подход к использованию LLM, фокусируясь на структурированных решениях и снижении затрат на вывод, что может изменить архитектуру многих прикладных ИИ-систем.
На прошлой неделе компания TypeSafe AI представила Jev, первый пример новой категории моделей, которую разработчики назвали «System One». Хотя сам автор материала предпочитает термин «decision models» (модели принятия решений), суть продукта заключается в изменении формата вывода: вместо генерации текста модель возвращает числа с плавающей точкой. Эти значения соответствуют категориям, ответам на вопросы «да/нет», оценкам и уровням уверенности. TypeSafe описывает Jev как функцию вызова с интеллектом уровня фронтир-моделей: на вход поступает неструктурированное состояние, а на выходе — типизированные вероятностные решения.
Экономическая модель Jev существенно отличается от стандартных LLM. Если обычные языковые модели тарифицируют как входные, так и выходные токены (при этом вывод часто стоит дороже), то Jev взимает плату только за вход. Вывод полностью бесплатен. Стоимость первого поколения модели составляет 0,042 доллара за миллион входных токенов, что дешевле даже GPT-5 Nano от OpenAI, цена которого начинается от 0,05 доллара за миллион.
Работа с API Jev строится вокруг понятия «state» (состояние). Пользователь формирует объект, содержащий строку, массив строк или набор пар «имя-значение», описывающий статью, клиента или другую запись. К этому состоянию можно приложить несколько вопросов, которые оцениваются параллельно. Это означает, что отправка множества запросов занимает примерно столько же времени, сколько один. Типы вопросов включают «Noul» (от Bernoulli) для бинарных ответов с вероятностью от 0 до 1, выбор из предложенных вариантов с распределением вероятностей и числовые оценки по заданной шкале.
Автор статьи отмечает, что такая архитектура идеально подходит для задач классификации: детектирование спама, назначение меток, приоритизация и ранжирование. Он также экспериментировал с использованием Jev для пере-ранжирования результатов поиска: сначала алгоритм BM25 находит 100 потенциальных совпадений, а затем Jev оценивает их релевантность. Однако возникает вопрос «черного ящика»: в отличие от LLM, где можно попросить модель объяснить решение (хотя и без гарантии точности), Jev возвращает лишь число. Это усложняет диагностику смещений (bias) в данных.
В качестве примера потенциальных проблем автор приводит эксперимент, где Jev оценивал города Сан-Франциско-Бей-Эреа по критерию «Хороший город?». Модель поставила Купертино на первое место, а Ист-Пало-Алто — на последнее. Это подчеркивает необходимость тщательного тестирования и структурированных экспериментов, особенно учитывая, что из-за низкой стоимости прогона тысяч тестовых запросов обходится в копейки.
Сообщество активно экспериментирует с нестандартным использованием Jev. Появились проекты вроде jevchat, где модель имитирует чат-бот, предсказывая следующий символ; jev-leftpad, реализующий функцию left-pad через подсчет пробелов; и jev-2048, играющий в головоломку 2048. Также ведутся работы по воссозданию аналогов Jev на базе открытых весов моделей, например, проект Kev использует Qwen 3.5 для создания версий с параметрами 0.8B, 4B и 9B.
Учитывая, что релиз состоялся менее недели назад, активность вокруг проекта впечатляет. Уже появился бенчмарк JevBench для сравнения моделей этого класса. Jev демонстрирует, как специализация на конкретных типах задач может привести к созданию более дешевых и быстрых инструментов по сравнению с универсальными языковыми моделями.