Google представила Gemini 3.5 Transcribe для розумної транскрипції аудіо

Google запустила модель Gemini 3.5 Transcribe для точного перетворення мовлення на текст у реальному часі та з записів. Вона розуміє самовиправлення, прибирає слова-паразити та доступна розробникам через API.
Компанія Google розширила лінійку моделей Gemini новим рішенням для розпізнавання мовлення. Gemini 3.5 Transcribe орієнтована на голосові інтерфейси та обіцяє якіснішу роботу порівняно з традиційними speech-to-text системами, особливо в шумному середовищі, зі складною термінологією та природними паузами.
Модель перетворює сирий аудіозапис одразу на очищений і структурований текст. Серед ключових можливостей — «розумна транскрипція», яка враховує самовиправлення мовця. Наприклад, фразу «зустрінемося у вівторок — ні, у середу» система одразу перетворює на фінальний варіант без зайвого фрагмента. Також автоматично видаляються слова-паразити на кшталт «ем» чи «ее».
Розробники можуть інтегрувати модель через Gemini API в Google AI Studio та Gemini Enterprise Agent Platform. Доступні два режими: потоковий для аудіо в реальному часі через Live API (gemini-3.5-transcribe-live) із затримкою менш як секунда та обробка записаних файлів через Interactions API (gemini-3.5-transcribe). Для записів модель підтримує визначення до трьох співрозмовників, часові мітки на рівні слів і спеціальні словники для професійної лексики.
За даними Artificial Analysis, середній Word Error Rate становить 4% у потоковому режимі та 2,6% для записаного аудіо. Час до отримання остаточної транскрипції скоротився на 70% порівняно з попередньою моделлю Chirp 3. Gemini 3.5 Transcribe розпізнає понад 85 мов, враховує акценти та діалекти, а також підтримує перемикання між мовами в межах однієї розмови.
Новинку вже інтегрують у продукти Google. На Android вона працює у функції Rambler клавіатури Gboard, де голосом можна диктувати текст, редагувати його та змінювати стиль. У застосунку Gemini для macOS модель використовує контекст екрана для виконання складніших дій, як-от аналіз файлів або генерація зображень. Також анонсовано підтримку в Chrome для диктування тексту в будь-яких полях вебсторінок.
Запуск відбувається на тлі зростання популярності голосових функцій: застосунок Gemini перевищив мільярд щомісячних активних користувачів, і 63% із них спілкуються з асистентом голосом.
Читайте також
Ще в розділі «Штучний інтелект»
- Google Pixel 11: еволюція замість революції — чи вартий апгрейд
- Microsoft з'ясувала, скільки працівники витрачають на ШІ — до $28 000
- Apple відкладає AirPods з камерою до 2027 року
- Anthropic запускає безкоштовну освітню платформу Claude Academy
- Google запускає Gemini Enterprise для юристів: що це означає для ринку







