xAI представила Grok Voice Transcribe 2.0: двукратный прирост точности транскрипции без изменения цены

Hacker News · оригинал

Материал подготовлен автоматизированной редакционной системой. Факты можно сверить по указанному первоисточнику.

Компания xAI выпустила обновленную модель распознавания речи Grok Voice Transcribe 2.0, которая демонстрирует вдвое большую точность по сравнению с предыдущей версией при сохранении прежнего тарифа. Новая модель занимает первое место среди потоковых систем на публичном лидерборде Artificial Analysis и уже используется корпоративными клиентами для автоматизации рабочих процессов.

Ценность: Модель решает ключевую проблему индустрии — низкую точность распознавания речи в шумных реальных условиях (телефония, мультиязычные команды). Это открывает возможности для интеграции ИИ-агентов в физические продукты и корпоративные инструменты, такие как Atlassian Loom, снижая барьеры для внедрения голосовых интерфейсов.

Компания xAI анонсировала выход Grok Voice Transcribe 2.0, новейшей модели преобразования речи в текст. Согласно заявлениям разработчиков, новая версия демонстрирует вдвое большую точность по сравнению с Grok Voice Transcribe 1.0, при этом стоимость использования остается неизменной. Модель построена на базе аудио-фундаментальной архитектуры, которая уже сейчас поддерживает десятки тысяч звонков в службу поддержки ежедневно, транскрибирует миллионы часов видеонаррации и управляет голосовыми агентами в физических устройствах, включая ассистента Grok в автомобилях Tesla.

Ключевым отличием новой версии является оптимизация под сложные реальные условия. Если большинство существующих моделей хорошо справляются с чистым аудио одного говорящего, то Grok Voice Transcribe 2.0 разработана для работы с нестабильными телефонными линиями, конкурирующими голосами, местными акцентами и чтением вслух таких данных, как номера телефонов или адреса электронной почты. Модель обучалась на уникальном наборе данных живого, шумного и многоязычного аудио, записанного в разнообразных средах, что позволило достичь высоких показателей точности в неидеальных условиях.

На публичном лидерборде Artificial Analysis Grok Voice Transcribe 2.0 занимает первое место по точности среди 32 потоковых моделей. Помимо внешних бенчмарков, xAI проводила внутренние тесты на четырех наборах данных из производственного трафика: телефонные звонки, диалоги с Grok, устные реквизиты (коды, email) и короткие многоязычные голосовые команды. Разработчики утверждают, что новая модель превосходит предыдущую версию во всех четырех категориях, лидируя в сегменте телефонной связи.

Значительный прогресс достигнут в области многоязычной поддержки. Модель транскрибирует десятки языков, автоматически определяет язык и отслеживает переключения в середине записи за один проход. Наибольший прирост точности по сравнению с первой версией наблюдается именно в многоязычном режиме. В частности, на наборе коротких фраз, таких как команды для автомобильных ассистентов, где контекст минимален, коэффициент ошибки слов (WER) снизился с 20,6% до 6,8%.

Практическое применение новой модели уже подтверждено корпоративными партнерами. Atlassian Loom, популярный инструмент для записи и обмена видеороликами, сообщил, что Grok Voice Transcribe 2.0 оказалась точнее их предыдущего решения. В результате компания перешла на использование новой модели для транскрибации всех видео. Это открывает новые сценарии автоматизации: например, запись плана действий в Loom и последующая передача текста в Cursor для непосредственного обновления кода.

Для разработчиков переход на новую версию не потребует изменения кода, если используются существующие интеграции Speech-to-Text API. Тарифы остаются прежними: пакетная транскрипция стоит 0,10 доллара США за час аудио, а потоковая — 0,20 доллара США за час, включая функции разделения говорящих, временные метки и ключевые термины. В ближайшие недели Grok Voice Transcribe 2.0 станет моделью по умолчанию в API, а версия 1.0 будет выведена из эксплуатации.