Google ha presentado Gemini 3.5 Transcribe, un modelo de transcripción de voz a texto que admite más de 85 idiomas. Esta herramienta no solo corrige errores de habla, sino que también elimina palabras de relleno y formatea el texto de manera automática.
Según Google, la tasa de error de palabras es del 4.0 por ciento para audio en tiempo real y 2.6 por ciento para grabaciones, con una latencia un 70 por ciento menor que su predecesor, Chirp 3. El modelo incluye dos interfaces, permitiendo el manejo de streaming en vivo y la atribución de hablantes en grabaciones.
La funcionalidad de "llamada de función" permite al modelo delegar tareas como generación de imágenes o búsquedas web a otros modelos de Gemini. Actualmente, está disponible en Google AI Studio y en la plataforma Gemini Enterprise Agent, además de estar integrado en Gboard para Android y en la aplicación Gemini para macOS, con soporte para Chrome en camino.