


O Voxtral Transcribe 2 é uma família de modelos de fala para texto de última geração da Mistral, oferecendo transcrição ultrarrápida e altamente precisa com capacidades em tempo real e diarização de falantes. Inclui dois modelos: o Voxtral Mini Transcribe V2 para transcrição em lote e o Voxtral Realtime para aplicações ao vivo. Juntos, eles suportam 13 idiomas, timestamps ao nível da palavra, ajuste de contexto e implantação com foco em privacidade — tudo com velocidade e custo líderes do setor.
Projetado especificamente para transcrição ao vivo, o Voxtral Realtime usa uma arquitetura de streaming inovadora que transcreve o áudio à medida que chega. Ele oferece latência configurável de até menos de 200ms, permitindo agentes de voz com precisão quase offline. Com um atraso de 480ms, mantém-se dentro de 1–2% de taxa de erro de palavras, igualando a qualidade em lote para aplicações em tempo real.
Este modelo em lote alcança qualidade de transcrição de ponta com aproximadamente 4% de taxa de erro de palavras no benchmark FLEURS e $0,003 por minuto. Ele supera o GPT-4o mini Transcribe, Gemini 2.5 Flash, Assembly Universal e Deepgram Nova em precisão, enquanto processa áudio cerca de 3 vezes mais rápido que o Scribe v2 da ElevenLabs por um quinto do custo.
Conquista
Gere transcrições com rótulos de falantes e horários de início/término precisos, ideal para reuniões, entrevistas e chamadas com múltiplos participantes. O ajuste de contexto permite fornecer até 100 palavras ou frases para guiar o modelo em direção à grafia correta de nomes, termos técnicos ou vocabulário específico de domínio.
O Voxtral Realtime é distribuído sob a licença Apache 2.0, implantável na borda para aplicações com foco em privacidade. Ambos os modelos suportam nativamente 13 idiomas, incluindo inglês, chinês, hindi, espanhol, árabe, francês, português, russo, alemão, japonês, coreano, italiano e holandês.
O Voxtral Transcribe 2 oferece a menor taxa de erro de palavras pelo menor preço, com latência em tempo real de até menos de 200ms.
Esta combinação de precisão, velocidade e eficiência de custos é incomparável no mercado atual. O Voxtral Mini Transcribe V2 alcança transcrição de ponta a $0,003 por minuto, enquanto o Voxtral Realtime possibilita uma nova classe de aplicativos com foco em voz, com arquitetura de streaming que não compromete a qualidade. O lançamento de pesos abertos sob a licença Apache 2.0 o diferencia ainda mais, permitindo implantações sensíveis à privacidade em dispositivos de borda.
Você precisa de uma solução de fala para texto que equilibre latência ultrabaixa, alta precisão e custo-benefício — especialmente para agentes de voz em tempo real, transcrição ao vivo ou aplicações com foco em privacidade. O modelo de pesos abertos e o suporte multilíngue o tornam uma escolha forte para desenvolvedores que criam em várias plataformas e idiomas.
Outras ferramentas que você pode considerar
Your meeting AI is missing half the picture. It hears what's said but ignores what's on screen. Shadow captures both—no bot needed—and turns that full context into action with custom AI tasks. Stop recapping. Start delivering.
TranslateGemma é uma nova suíte de modelos de tradução de IA abertos, construída sobre o Gemma 3 do Google. Ela possibilita uma comunicação de alta qualidade em 55 idiomas, combinando forte precisão com eficiência excepcional. Projetada para rodar em dispositivos móveis, locais e ambientes em nuvem sem comprometer o desempenho.
Mistral 3 inclui três modelos pequenos e densos de última geração (14B, 8B e 3B) e o Mistral Large 3 – nosso modelo mais capaz até o momento – um modelo esparso de mistura de especialistas treinado com 41B de parâmetros ativos e 675B de parâmetros totais. Todos os modelos são lançados sob a licença Apache 2.0. Os modelos Ministral representam a melhor relação custo-desempenho em sua categoria. Ao mesmo tempo, o Mistral Large 3 se junta ao seleto grupo de modelos de código aberto de fronteira com ajuste fino instrucional.
O Okara permite que você utilize mais de 30 modelos de IA open-source poderosos sem se preocupar com a configuração de infraestrutura. Os melhores modelos, como Kimi e DeepSeek, são grandes demais para rodar no seu notebook — nós cuidamos disso para você. Alterne entre modelos, pesquise no Google, Reddit, X, YouTube diretamente nos seus chats, analise arquivos, gere imagens e trabalhe em equipe. Tudo é criptografado e nunca treinamos com seus dados.
Loading comments…
Criador
async_apple
Informações do projeto
Palavras-chave do produto