общество самит google gemini

Google выпустила модель распознавания речи, которая пытается понять не только слова, но и то, что человек хотел сказать

Google представила Gemini 3.5 Transcribe — новую модель для преобразования речи в текст. Она работает как с заранее записанным аудио, так и в реальном времени с задержкой меньше секунды и умеет разделять говорящих, ставить временные метки и переключаться между языками прямо посреди разговора.Интереснее обычной транскрипции то, что модель автоматически чистит речь: убирает «э-э», учитывает исправления человека на ходу и может сразу выдавать нормально оформленный текст.

Google отдельно продвигает её как основу для голосовых агентов, а не просто сервис расшифровки диктофона.На многоязычном тесте FLEURS Google заявляет ошибку распознавания около 5%, а время до окончательной транскрипции, по данным Artificial Analysis, сократилось примерно на 70% относительно предыдущего решения Chirp 3.

DMCA