


Voxtral Transcribe 2 es una familia de modelos de voz a texto de última generación de Mistral, que ofrece transcripción ultrarrápida y de alta precisión con capacidades en tiempo real y diarización de hablantes. Incluye dos modelos: Voxtral Mini Transcribe V2 para transcripción por lotes y Voxtral Realtime para aplicaciones en vivo. Juntos, admiten 13 idiomas, marcas de tiempo a nivel de palabra, sesgo de contexto y despliegue priorizando la privacidad, todo a una velocidad y costo líderes en la industria.
Diseñado específicamente para transcripción en vivo, Voxtral Realtime utiliza una arquitectura de transmisión novedosa que transcribe el audio a medida que llega. Ofrece latencia configurable de hasta menos de 200 ms, lo que permite agentes de voz con precisión casi fuera de línea. Con un retraso de 480 ms, se mantiene dentro del 1–2% de tasa de error de palabras, igualando la calidad por lotes para aplicaciones en tiempo real.
Este modelo por lotes logra una calidad de transcripción de última generación con aproximadamente un 4% de tasa de error de palabras en el punto de referencia FLEURS y $0.003 por minuto. Supera a GPT-4o mini Transcribe, Gemini 2.5 Flash, Assembly Universal y Deepgram Nova en precisión, mientras procesa audio aproximadamente 3 veces más rápido que Scribe v2 de ElevenLabs a una quinta parte del costo.
Logro
Genera transcripciones con etiquetas de hablante y tiempos de inicio/fin precisos, ideal para reuniones, entrevistas y llamadas multiparticipante. El sesgo de contexto permite proporcionar hasta 100 palabras o frases para guiar al modelo hacia la ortografía correcta de nombres, términos técnicos o vocabulario específico del dominio.
Voxtral Realtime se distribuye bajo la licencia Apache 2.0, desplegable en dispositivos periféricos para aplicaciones que priorizan la privacidad. Ambos modelos admiten de forma nativa 13 idiomas, incluidos inglés, chino, hindi, español, árabe, francés, portugués, ruso, alemán, japonés, coreano, italiano y neerlandés.
Voxtral Transcribe 2 ofrece la tasa de error de palabras más baja al precio más bajo, con latencia en tiempo real de hasta menos de 200 ms.
Esta combinación de precisión, velocidad y eficiencia de costos no tiene igual en el mercado actual. Voxtral Mini Transcribe V2 logra una transcripción de última generación a $0.003 por minuto, mientras que Voxtral Realtime permite una nueva clase de aplicaciones centradas en la voz con una arquitectura de transmisión que no compromete la calidad. El lanzamiento de pesos abiertos bajo Apache 2.0 lo distingue aún más, permitiendo despliegues sensibles a la privacidad en dispositivos periféricos.
Necesitas una solución de voz a texto que equilibre latencia ultrabaja, alta precisión y rentabilidad, especialmente para agentes de voz en tiempo real, transcripción en vivo o aplicaciones que priorizan la privacidad. El modelo de pesos abiertos y el soporte multilingüe lo convierten en una opción sólida para desarrolladores que crean en múltiples plataformas e idiomas.
Otras herramientas que podrías considerar
Your meeting AI is missing half the picture. It hears what's said but ignores what's on screen. Shadow captures both—no bot needed—and turns that full context into action with custom AI tasks. Stop recapping. Start delivering.
TranslateGemma es una nueva suite de modelos de traducción de IA abiertos basados en Gemma 3 de Google. Permite una comunicación de alta calidad en 55 idiomas, combinando una gran precisión con una eficiencia excepcional. Diseñada para funcionar en dispositivos móviles, locales y entornos en la nube sin comprometer el rendimiento.
Mistral 3 incluye tres modelos pequeños y densos de última generación (14B, 8B y 3B) y Mistral Large 3, nuestro modelo más potente hasta la fecha: un modelo disperso de mezcla de expertos entrenado con 41B de parámetros activos y 675B de parámetros totales. Todos los modelos se publican bajo la licencia Apache 2.0. Los modelos Ministral representan la mejor relación rendimiento-costo en su categoría. Al mismo tiempo, Mistral Large 3 se une a las filas de los modelos de código abierto de vanguardia ajustados por instrucciones.
Okara te permite usar más de 30 potentes modelos de IA de código abierto sin tener que lidiar con la configuración de infraestructura. Los mejores modelos como Kimi y DeepSeek son demasiado grandes para ejecutarlos en tu portátil, nosotros nos encargamos de eso por ti. Cambia entre modelos, busca en Google, Reddit, X, YouTube desde tus chats, analiza archivos, genera imágenes y trabaja con tu equipo. Todo está cifrado y nunca entrenamos con tus datos.
Loading comments…
Creador
async_apple
Información del proyecto
Palabras clave del producto