Gemini Audio
Gemini Audio — набір моделей від Google для роботи з голосом у реальному часі. Включає три основні компоненти: Live Dialog для низьколатентних розмов з природним ритмом мови, Live Translate для переговорів мовами (70+ мов), та Speech Generation для контрольованого синтезу — від коротких фрагментів до довгих текстів з точним керуванням інтонацією, темпом і тоном. Audio Understanding йде далі простої транскрипції: розпізнає учасників розмови та розуміє намір за словами. Моделі оптимізовані для різних workflows розробників: 3.1 Flash Live обробляє складні завдання з урахуванням нюансів (тональність, темп), 3.1 Flash TTS дає гранульярний контроль через аудіо-теги, а Live Translate забезпечує реальний переклад мови в мову.