Fish Audio levanta US$ 52 millones en su ronda semilla
La plataforma de síntesis de voz alcanza los 21 millones de dólares en ingresos recurrentes y proyecta nuevos modelos de audio en tiempo real.

La empresa emergente Fish Audio anunció el 28 de julio de 2026 el cierre de una ronda de inversión semilla por 52 millones de dólares. El financiamiento fue codirigido por las firmas Coreline Ventures y Capital Today, con el respaldo adicional de capitales como 359 Capital y HF0. La inyección de recursos coincide con el primer aniversario de la compañía afincada en Palo Alto, periodo en el cual alcanzó una facturación anual recurrente de 21 millones de dólares y sumó más de 8 millones de usuarios entre sus formatos de código abierto y su plataforma alojada.
El proyecto surgió de manera artesanal por iniciativa de Shijia Liao, exinvestigador de Nvidia y actual científico jefe de la firma. Ante la falta de expresividad en los sintetizadores de voz disponibles, Liao entrenó un modelo inicial utilizando una única unidad de procesamiento gráfico comercial. Ese desarrollo dio origen al repositorio de código abierto Fish Speech en GitHub, que ya acumula más de 31.000 estrellas y es utilizado por desarrolladores independientes y estudios de videojuegos.
Durante su primer año de operaciones, la firma lanzó cinco modelos tecnológicos: cuatro dedicados a la generación de habla y uno a la transcripción de texto a partir de audio. Tres de los motores de generación de voz se distribuyen de forma gratuita, entre ellos el modelo S2, liberado el 9 de marzo de 2026 con 4.000 millones de parámetros y entrenado sobre 10 millones de horas de audio en cerca de 80 idiomas. Su sistema permite aplicar etiquetas expresivas a nivel de palabra con más de 15.000 controles de lenguaje natural.
La versión más reciente de la plataforma, denominada S2.1 Pro, ofrece capacidad de clonación vocal en 15 segundos a partir de una muestra de cinco segundos en más de 83 idiomas. Este motor alcanza una latencia de respuesta de unos 70 milisegundos y se ofrece sin costo a través de una interfaz de programación de aplicaciones hasta el 31 de agosto de 2026. Tras esa fecha, las empresas con facturaciones superiores a un millón de dólares deberán contratar planes de pago diseñados para necesidades operativas avanzadas.
La estrategia comercial de Fish Audio combina la distribución masiva entre programadores con contratos corporativos orientados a clientes que requieren acuerdos de nivel de servicio rigurosos. Entidades como HeyGen, Sanas y Plaud emplean esta tecnología para crear avatares virtuales y sistemas interactivos. Asimismo, para organizaciones que operan en entornos altamente regulados, la compañía ofrece instalaciones en servidores propios y protocolos de retención nula de datos.
En el transcurso de 2026, la plataforma afrontó cuestionamientos por la presencia de voces subidas sin la autorización de sus propietarios originales dentro de su biblioteca colaborativa, la cual alberga más de dos millones de registros. Para resolver estos reclamos, la dirección implementó el 4 de julio de 2026 un mecanismo automatizado de verificación de identidad que reduce los tiempos de procesamiento de bajas a menos de tres minutos.
De cara al cierre de 2026, la compañía prevé lanzar un modelo de comprensión de audio y avanza en el desarrollo de un sistema de comunicación directa de habla a habla para ingresar al mercado de asistentes de voz dinámicos.

