Google представила Gemini 3.5 Transcribe для розумної транскрипції аудіо

·718 слівредакція
Google представила Gemini 3.5 Transcribe для розумної транскрипції аудіо

Google запустила модель Gemini 3.5 Transcribe для точного перетворення мовлення на текст у реальному часі та з записів. Вона розуміє самовиправлення, прибирає слова-паразити та доступна розробникам через API.

Компанія Google розширила лінійку моделей Gemini новим рішенням для розпізнавання мовлення. Gemini 3.5 Transcribe орієнтована на голосові інтерфейси та обіцяє якіснішу роботу порівняно з традиційними speech-to-text системами, особливо в шумному середовищі, зі складною термінологією та природними паузами.

Модель перетворює сирий аудіозапис одразу на очищений і структурований текст. Серед ключових можливостей — «розумна транскрипція», яка враховує самовиправлення мовця. Наприклад, фразу «зустрінемося у вівторок — ні, у середу» система одразу перетворює на фінальний варіант без зайвого фрагмента. Також автоматично видаляються слова-паразити на кшталт «ем» чи «ее».

Розробники можуть інтегрувати модель через Gemini API в Google AI Studio та Gemini Enterprise Agent Platform. Доступні два режими: потоковий для аудіо в реальному часі через Live API (gemini-3.5-transcribe-live) із затримкою менш як секунда та обробка записаних файлів через Interactions API (gemini-3.5-transcribe). Для записів модель підтримує визначення до трьох співрозмовників, часові мітки на рівні слів і спеціальні словники для професійної лексики.

За даними Artificial Analysis, середній Word Error Rate становить 4% у потоковому режимі та 2,6% для записаного аудіо. Час до отримання остаточної транскрипції скоротився на 70% порівняно з попередньою моделлю Chirp 3. Gemini 3.5 Transcribe розпізнає понад 85 мов, враховує акценти та діалекти, а також підтримує перемикання між мовами в межах однієї розмови.

Новинку вже інтегрують у продукти Google. На Android вона працює у функції Rambler клавіатури Gboard, де голосом можна диктувати текст, редагувати його та змінювати стиль. У застосунку Gemini для macOS модель використовує контекст екрана для виконання складніших дій, як-от аналіз файлів або генерація зображень. Також анонсовано підтримку в Chrome для диктування тексту в будь-яких полях вебсторінок.

Запуск відбувається на тлі зростання популярності голосових функцій: застосунок Gemini перевищив мільярд щомісячних активних користувачів, і 63% із них спілкуються з асистентом голосом.

Читайте також