Google presentó el 26 de agosto Gemini 3.5 Transcribe, una herramienta orientada a la transcripción inteligente en tiempo real. Su propuesta va más allá de convertir voz en texto: el sistema puede interpretar y estructurar el habla para generar transcripciones más limpias y utilizables.
Entre sus capacidades están la eliminación de muletillas, la interpretación de autocorrecciones, el reconocimiento de vocabulario personalizado, la separación de hablantes y la incorporación de marcas de tiempo. Además, puede trabajar con más de 85 idiomas y, según Google, ofrece una latencia inferior al segundo en streaming.
De transcribir palabras a interpretar mejor el habla
Gemini 3.5 Transcribe incorpora distintas funciones destinadas a mejorar la calidad y utilidad de una transcripción.
Entre ellas se encuentran:
- eliminación de muletillas;
- interpretación de autocorrecciones realizadas durante el habla;
- reconocimiento de vocabulario personalizado;
- separación de diferentes hablantes;
- incorporación de timestamps;
- compatibilidad con más de 85 idiomas.
Estas capacidades permiten trabajar con la voz de una forma más estructurada, especialmente en situaciones donde intervienen varias personas o donde la transcripción se utiliza posteriormente para generar otros materiales.
Transcripción en tiempo real con latencia inferior al segundo
Uno de los elementos destacados por Google es su funcionamiento en streaming.
La compañía señala que Gemini 3.5 Transcribe puede ofrecer una latencia inferior al segundo, lo que permite realizar la transcripción mientras se desarrolla una conversación, clase, reunión o sesión.
La transcripción deja así de ser únicamente un proceso posterior sobre un archivo de audio o vídeo y puede integrarse en situaciones de trabajo en tiempo real.
Aplicaciones en empresas de formación
Para una empresa dedicada a la formación, las capacidades de Gemini 3.5 Transcribe tienen aplicaciones directas sobre contenidos que ya se generan habitualmente en formato oral o audiovisual.
Entre los principales usos están:
- transcribir clases para disponer de una versión escrita de las sesiones;
- resumir webinars a partir de su contenido;
- generar materiales desde sesiones formativas;
- analizar reuniones utilizando su contenido hablado;
- transformar vídeo y audio en contenido escrito.
El elemento común es la posibilidad de convertir información originalmente expresada mediante voz en contenido textual que posteriormente pueda utilizarse en otros procesos de trabajo.
La voz como una interfaz de trabajo más útil
Gemini 3.5 Transcribe plantea un uso de la transcripción que no se limita a reproducir literalmente lo que se dice.
Funciones como la separación de hablantes, la eliminación de muletillas, la interpretación de autocorrecciones, los timestamps o el reconocimiento de vocabulario personalizado permiten generar un texto más estructurado a partir de una conversación o grabación.
En ámbitos como la formación, esto abre una vía directa para convertir clases, webinars, reuniones y contenidos audiovisuales en materiales escritos aprovechables.