Voz en tiempo real a US$1.38 por hora: cada conversación puede volverse memoria institucional
Con Gemini 3.8 Live, transcribir y capturar cada interacción hablada deja de ser un costo prohibitivo y pasa a ser una decisión de diseño
Google lanzó modelos de voz en tiempo real a costo de producción. La oportunidad no está solo en atender llamadas: está en que ninguna conversación crítica vuelva a perderse sin dejar huella institucional.
El 15 de septiembre de 2026, Google presentó Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, un par de modelos de diálogo en vivo disponibles vía Gemini API y AI Studio. Procesan voz con visión y llamadas a API de forma simultánea, y su precio los vuelve viables para producción: **US$0.005 por minuto de entrada de audio y US$0.018 por minuto de salida**, alrededor de US$1.38 la hora. La variante Extended Thinking encabeza el ranking de calidad speech-to-speech de Artificial Analysis.
La lectura habitual apunta a call centers y asistentes de voz. Existe una segunda lectura, menos obvia y más estratégica: cuando capturar y transcribir voz cuesta casi nada, **cada conversación puede convertirse en memoria organizacional**.
## El vínculo con la amnesia corporativa
Buena parte del conocimiento crítico de una organización vive en conversaciones que nunca se documentan: la llamada con el cliente clave, la reunión donde se tomó la decisión, la explicación que el colaborador senior da de memoria antes de retirarse. Ese conocimiento se pierde por un motivo práctico —capturarlo y estructurarlo era caro y tedioso—.
El costo acaba de caer. Y con él, la oportunidad de cerrar varias de las brechas que producen amnesia corporativa:
- **Amnesia individual.** Las conversaciones donde un experto explica cómo funciona algo quedan transcritas, indexadas y consultables, en lugar de irse con la persona.
- **Amnesia por relevo generacional.** El traspaso de experiencia deja de depender de la buena voluntad de documentar; la captura ocurre mientras se habla.
- **Amnesia tecnológica.** Al integrarse por API, la voz transcrita alimenta directamente el repositorio central en lugar de quedar atrapada en una grabación que nadie vuelve a abrir.
La clave está en el diseño: transcribir por transcribir genera ruido. El valor aparece cuando la transcripción se estructura, se etiqueta y se conecta al repositorio de conocimiento de la organización.
## La lectura de Tabuga
La tecnología de captura dejó de ser la barrera. Lo que decide si una conversación se vuelve memoria útil o archivo muerto es el proceso alrededor: qué se captura, cómo se estructura y quién puede consultarlo después. La herramienta ya es asequible; la disciplina de memoria sigue siendo la ventaja.
📅 15 sep 2026 — Fuente: Google / MarkTechPost.