Традиционные системы распознавания речи регулярно спотыкаются о заминки в разговоре, фоновый шум и отраслевую терминологию. На выходе они выдают дословный фонетический текст, который затем приходится прогонять через языковые модели для постобработки и очистки. С релизом Gemini 3.5 Transcribe компания Google пытается устранить эти операционные издержки. Это переход от механического преобразования речи в текст к контекстно-зависимой обработке, которая автоматически удаляет слова-паразиты, учитывает естественные самоисправления говорящего и сразу выдает структурированный текст.
По данным бенчмарка Artificial Analysis, Gemini 3.5 Transcribe демонстрирует средний уровень ошибок в словах (WER) на уровне 4,0% для потокового распознавания и 2,6% для пакетной обработки по сравнению с Chirp 3.
«В отличие от классических моделей распознавания речи, которые испытывают сложности с фоновым шумом, сложным жаргоном и очисткой от речевого мусора, Gemini 3.5 Transcribe преобразует исходное аудио напрямую в точный, выверенный и отформатированный текст».
Мультиязычность и вызовы функций
Помимо базового распознавания, система автоматически определяет и транскрибирует более 85 языков, корректно обрабатывая выраженные региональные акценты. Для записанных аудиофайлов и корпоративных совещаний модель размечает таймкоды на уровне отдельных слов и разделяет реплики для групп до трех спикеров. При этом диаризация для большего числа участников пока остается экспериментальной возможностью.
Интеграция в рабочий стек компании происходит через два интерфейса: модель gemini-3.5-transcribe-live в составе Live API для двустороннего потокового аудио с низкой задержкой и gemini-3.5-transcribe через Interactions API для асинхронной обработки сохраненных записей. В десктопных сценариях, таких как приложение Gemini для macOS, движок напрямую использует вызов функций (function calling). Это позволяет передавать инструкции downstream-моделям — например, для обновления CRM, анализа файлов или маршрутизации задач — минуя этап промежуточной очистки транскрипта.
Доступность для корпоративного сектора
Google развернула модель на всех платформах для разработчиков: она уже доступна в Google AI Studio и Gemini API, а корпоративные клиенты могут использовать ее напрямую внутри платформы Gemini Enterprise Agent Platform. Потребительские функции на базе нового движка также запущены на Android в рамках инструментов диктовки Rambler.
Объединение транскрипции и смысловой очистки в единый шаг позволяет бизнесу существенно сократить расход токенов и задержку при работе голосовых ИИ-агентов. Однако техническим командам стоит учитывать, что расшифровка многопользовательских встреч пока ограничена тремя спикерами до доработки алгоритма диаризации.