Google представила Gemini 3.5 Transcribe — нову модель для розуміння мовлення

·601 слівредакція
Google представила Gemini 3.5 Transcribe — нову модель для розуміння мовлення

Google запустила Gemini 3.5 Transcribe, яку називає своєю найточнішою системою перетворення мовлення на текст. Модель вміє розуміти наміри користувача, прибирати слова-паразити та обробляти шум.

Google оголосила про випуск Gemini 3.5 Transcribe — нової моделі розпізнавання мовлення, яку компанія позиціонує як найточнішу у своїй лінійці. Система перетворює необроблене аудіо на структурований і відформатований текст, справляючись із фоновим шумом, складною термінологією та обірваними фразами.

Модель доступна розробникам через два окремі API. Версія gemini-3.5-transcribe-live, що працює через Live API, забезпечує потокову передачу в реальному часі із затримкою менш ніж секунда. Вона підходить для інтерактивних голосових застосунків. Версія gemini-3.5-transcribe через Interactions API розшифровує вже записані аудіофайли, наприклад записи зустрічей, із розподілом реплік між спікерами та часовими мітками для кожного слова.

Ключова особливість Gemini 3.5 Transcribe — робота з мовленням у його природному вигляді. Модель коректно обробляє самовиправлення («зустрінемось у вівторок — ні, в середу»), видаляє слова-паразити на кшталт «ну» чи «типу» та автоматично форматує текст. Також вона вміє делегувати складні завдання, як-от генерацію зображень чи аналіз файлів, іншим моделям Gemini через функціональні виклики. Ця можливість поки доступна в застосунку Gemini для macOS.

За даними незалежної платформи Artificial Analysis, середній рівень помилок (WER) у потоковому режимі становить 4,0%, а для записаного аудіо — 2,6%. Модель впевнено працює в шумному середовищі та точно розпізнає буквено-цифрові послідовності, зокрема поштові індекси та номери замовлень. Порівняно з попередньою моделлю Chirp 3, час до отримання фінальної транскрипції скоротився на 70%. На бенчмарку FLEURS модель показала 5,50% помилок у потоковому режимі та 5,04% для попередньо записаного аудіо.

Gemini 3.5 Transcribe підтримує понад 85 мов, включаючи регіональні акценти та діалекти. Користувачі можуть налаштовувати власний словник для розпізнавання спеціалізованої термінології. У записаному аудіо модель точно атрибутує мовлення для до трьох учасників розмови; підтримка більшої кількості спікерів працює в експериментальному режимі.

Технологію вже інтегровано в кілька продуктів Google. На Android вона лежить в основі функції Rambler у Gboard, яка перетворює усне мовлення на відформатований текст і дозволяє голосом вносити правки. У застосунку Gemini для macOS модель транскрибує мовлення та підтримує голосові команди з урахуванням контексту екрана. У Google Antigravity модель узгоджує контекст екрана та історію чату (за згодою користувача), а в Google AI Studio її можна використовувати для голосового «вайб-кодингу».

Найближчим часом підтримка моделі з’явиться в браузері Chrome — користувачі зможуть диктувати текст у будь-яке текстове поле на сторінці. Розробники вже можуть використовувати модель у публічному попередньому доступі через Gemini API в Google AI Studio та Google Antigravity. Для корпоративних клієнтів вона доступна через Gemini Enterprise Agent Platform і незабаром з’явиться в Gemini Enterprise for Customer Experience. Серед платформ, які вже інтегрували модель через Gemini Live API, — Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel та Vision Agents.

Читайте також