El modelo permite transcribir audio grabado y conversaciones en tiempo real, con identificación de hablantes, marcas de tiempo y detección automática de idiomas