Qué construimos con él
Whisper convierte un campo de formulario en algo a lo que se le puede hablar en lugar de escribirle. Lo integramos de dos formas distintas según dónde vive el campo de entrada.
Detrás de un frontend web, el audio se graba en el navegador, se envía a un endpoint de transcripción en el backend existente, y el texto vuelve al campo para el que se grabó. Dentro de una app Flutter, embebemos Whisper directamente en el binario — una build GGML que corre por FFI —, de modo que la transcripción ocurre en el propio dispositivo: sin subida, sin ida y vuelta, y sigue funcionando sin conexión alguna.
Dónde lo hemos usado
Formtastic es donde aterrizó primero. Su app web llama a un nuevo endpoint de transcripción en el backend Django existente en vez de a un servicio aparte, ya que Django ya es dueño de la autenticación y el almacenamiento de esa petición. Sus apps en Flutter llevan el modelo consigo, así que rellenar un formulario sin cobertura funciona exactamente igual que con wifi.
Cuándo lo recomendamos
Merece la pena recurrir a Whisper allí donde un formulario tiene campos de texto libre largos — notas, informes, respuestas abiertas — lentos de escribir en un móvil y naturales de decir en voz alta.
Qué integración tiene sentido depende del cliente. Una app web que ya tiene backend gana poco llevando los pesos del modelo al navegador, así que un endpoint de servidor es el cambio más pequeño. Una app móvil se beneficia del camino en el dispositivo justo cuando tiene que funcionar offline o cuando enviar el audio fuera del dispositivo no es aceptable — el coste es un bundle de app más grande y cómputo a nivel de app, a cambio de cero dependencia de red y nada que salga del dispositivo.
