Google представила модели Gemini 3.8 Live для голосовых агентов

Hacker News · оригинал

Материал подготовлен автоматизированной редакционной системой. Факты можно сверить по указанному первоисточнику.

Google анонсировала две новые модели Gemini 3.8 Live, ориентированные на оптимизацию голосовых интерфейсов и обработку сложных задач в реальном времени. Модели отличаются высокой скоростью отклика, поддержкой многоязычности и интеграцией с корпоративными инструментами.

Ценность: Новые модели позволяют создавать более естественные голосовые диалоги с ИИ, поддерживая одновременное выполнение фоновых задач и переключение между языками без потери контекста.

Компания Google представила два новых поколения моделей искусственного интеллекта — Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Эти решения разработаны для улучшения качества голосовых взаимодействий, делая общение с ИИ более интуитивным и интеллектуальным. Основная цель нововведений заключается в обеспечении надежной работы голосовых агентов в производственных средах, а также в повышении плавности диалогов в таких сервисах, как приложение Gemini, Google Workspace и поисковая система Search.

Модель Gemini 3.8 Live позиционируется как инструмент для масштабирования и снижения затрат. Она сочетает в себе разговорный интеллект с плавным ведением диалога и визуальным анализом данных. Согласно предоставленным данным, эта модель занимает второе место в рейтинге Speech Agent Arena, демонстрируя высокую степень предпочтения со стороны пользователей. При этом компания подчеркивает ее высокую экономическую эффективность, что делает модель привлекательной для разработчиков и предприятий, которым требуется производительность при ограниченном бюджете.

В свою очередь, Gemini 3.8 Live Extended Thinking предназначена для задач высокой сложности. Эта версия обеспечивает повышенный уровень интеллекта и многошагового рассуждения. По данным Artificial Analysis, модель занимает первое место в индексе качества голосового взаимодействия (Speech to Speech Quality Index) с результатом 82,6 балла. Также она лидирует в выполнении агентных задач, показывая результат 68,6% на тесте τ-Voice и 35,1% на бенчмарке Sierra’s τ-Voice-banking. В области рассуждений модель набирает 97,7% на Big Bench Audio, сохраняя при этом конкурентоспособную цену по сравнению с другими передовыми моделями.

Технически Gemini 3.8 Live обрабатывает визуальные входные данные в режиме, близком к реальному времени, что обогащает контекст разговора и позволяет давать более полезные ответы. Важной особенностью является автоматическое обнаружение и переключение между 97 поддерживаемыми языками прямо во время беседы. Кроме того, модель способна выполнять вызовы инструментов и API в фоновом режиме, продолжая при этом разговор с пользователем. Это позволяет модели подтверждать получение запроса и поддерживать диалог, пока фоновые задачи завершаются.

Для задач, требующих глубокого анализа, версия Extended Thinking рассуждает и говорит одновременно. Она использует ранние вербальные сигналы, такие как «Дайте мне это проверить», чтобы естественно реагировать на запросы, и предоставляет живое описание прогресса многошаговых фоновых задач. Такой подход позволяет поддерживать непрерывный разговорный поток, даже когда ИИ выполняет сложные вычисления или действия в фоне.

Google также подчеркивает важность прозрачности и безопасности. Весь аудио-контент, генерируемый их продуктами, маркируется водяным знаком SynthID. Этот незаметный для человеческого уха знак вплетается непосредственно в аудиовыход, что позволяет обнаруживать сгенерированный ИИ контент и помогает предотвращать распространение дезинформации. Для получения дополнительной информации о подходе к безопасности компания рекомендует ознакомиться с карточкой модели.

Модели уже доступны для использования. Gemini 3.8 Live и Extended Thinking запускаются сегодня для разработчиков через Gemini API и Google AI Studio. Для предприятий они доступны в режиме частного предпросмотра в Gemini Enterprise, а также скоро появятся в Gemini Enterprise for Customer Experience. Для широкой аудитории функции будут интегрированы в Search Live, Gemini Live, а также в сервисы Google Workspace для подписчиков планов Pro и Ultra, включая Docs, Gmail и Keep. Партнерами по разработке голосовых интерфейсов выступают такие платформы, как Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel и Vision Agents.