Google расширяет возможности ИИ для поддержки более 300 языков
Google AI · оригинал
Материал подготовлен автоматизированной редакционной системой. Факты можно сверить по указанному первоисточнику.

Google представила новые инструменты на базе Gemini, способные обрабатывать речь в реальном времени и поддерживать более 250 языков. Компания также анонсировала инициативы по сбору данных для малоизученных языков и созданию офлайн-решений для регионов с ограниченным доступом к интернету.
Ценность: Данные разработки демонстрируют переход от простого перевода текста к глубокому пониманию контекста, эмоций и культурных особенностей речи. Это критически важно для инклюзивности технологий, позволяя миллиардам людей в разных регионах мира эффективно взаимодействовать с цифровыми сервисами на родном языке.
Технологии Google сегодня обеспечивают взаимодействие пользователей более чем на 300 языках, охватывая 86% мирового населения. Компания подчеркивает, что исторически цифровые инструменты были оптимизированы преимущественно для доминирующих языков, оставляя тысячи живых диалектов за пределами цифрового мира. С момента запуска Google Translate в 2006 году компания расширила поддержку с нескольких языков до более чем 250, однако перевод текста считается недостаточным для полного понимания коммуникации. Современные системы стремятся учитывать интонацию, темп и эмоциональный окрас речи, которые теряются при традиционной транскрипции аудио в текст.
Для решения этой задачи Google перешла от многоэтапной обработки к «нативному аудиointelligence». Модели семейства Gemini теперь обрабатывают аудиопоток напрямую, улавливая не только звук, но и намерение говорящего. Это позволяет корректно воспринимать смешение языков в одной фразе (код-свитчинг) и естественные паузы. Инструмент Gemini 3.5 Live Translate обеспечивает устный перевод в реальном времени для 70 языков и более 2000 пар, сохраняя эмоциональные оттенки речи.
В области распознавания речи модель Gemini 3.5 Transcribe демонстрирует высокую точность даже в шумных условиях или при использовании сложной терминологии. На базе этой технологии работает функция Rambler в Android Gboard, которая очищает речь от лишних слов, исправляет грамматику и позволяет редактировать текст голосовыми командами. Компания также объявила об инициативе «1000 языков», цель которой — поддержка 1000 самых распространенных языков мира.
Для работы с малоизученными языками используется модель Universal Speech Model, обученная на 12 миллионах часов аудио. Применяется метод трансферного обучения, который переносит закономерности из данных богатых языков на языки с ограниченным объемом обучающих данных. Эта работа опирается на 25 лет открытых исследований и более чем 400 рецензируемых научных работ в области обработки речи.
Ключевым аспектом стратегии является сбор локальных данных через партнерства с сообществами. Проект WAXAL, созданный совместно с Makerere University и Digital Umuganda, охватывает 27 языков Африки к югу от Сахары. Project Vaani в сотрудничестве с IISc и Bhashini собрал более 30 000 часов речи на 109 индийских языках. Инициатива Amplify объединила более 1600 экспертов из 20 университетов для создания мультимодальных данных, отражающих локальные нюансы.
Для пользователей без стабильного доступа к интернету разработана семейство моделей TranslateGemma. Эти легкие открытые модели работают на устройстве, обеспечивая перевод на 55 языках без облачного подключения. Кроме того, Google поддерживает проект Viamo, который адаптирует возможности Gemini для обычных кнопочных телефонов, что уже позволило ответить на более чем 2 миллиона вопросов в Руанде.
Вопросы доступности также находятся в центре внимания. Система Sign Language-to-Text (SL2T) обучена на более чем 50 языках жестов и позволяет диктовать текст жестами в Gboard и Live Transcribe, начиная с американского языка жестов. Google также улучшает произношение местных топонимов, например, в Новой Зеландии, работая с экспертами по маори для интеграции культурно аутентичных произношений в модели синтеза речи.