

Descreva / automatize uma tarefa em inglês simples e ele controla um navegador real para executá-la: navegue por um site, percorra um fluxo de várias etapas, preencha um formulário, acesse uma página que só é exibida após interação. O resultado é transmitido de volta em uma única chamada de API. É uma API que você chama, não um framework que você instala. Navegador e LLM incluídos, nada para hospedar, sem limite de concorrência. A automação baseada em árvore de acessibilidade consome de 60 a 80% menos tokens do que agentes baseados em captura de tela. Criado pela Mozilla. Efêmero, sem treinamento com seus dados.
Loading comments…
Informações do projeto
Palavras-chave do produto
O Tabstack Browser Automation é uma API que permite descrever uma tarefa web em inglês simples e tê-la executada em um navegador real. Você fornece uma tarefa como "Encontre o voo direto mais barato de SFO para JFK que evite horários de pico e adicione ao carrinho", e o Tabstack navega, clica, preenche formulários e conclui fluxos de várias etapas em páginas que você não controla. O navegador e o LLM são executados na infraestrutura do Tabstack — você faz apenas uma única chamada de API e recebe o resultado finalizado. É construído pela Mozilla, usa a árvore de acessibilidade em vez de capturas de tela e mantém seus dados efêmeros, sem treinamento com suas entradas.
O Tabstack elimina toda a pilha de automação de navegador. Não há framework para instalar, modelo para conectar ou navegador para hospedar. Você chama /automate com uma tarefa em linguagem natural e uma URL, e o serviço cuida de tudo — navegação, cliques, preenchimento de formulários e extração de resultados — transmitindo eventos enquanto trabalha.
Em vez de enviar imagens de página inteira a cada ação (o que queima milhares de tokens de visão), o Tabstack lê a árvore de acessibilidade do navegador. Este texto estruturado compacto — botão "Pesquisar", caixa de texto "Endereço de e-mail", link "Preços" — usa 60 a 80% menos tokens por ação do que agentes baseados em captura de tela. Em escala, isso é uma diferença real de custo, não uma otimização menor.
O agente trabalha em páginas dinâmicas, com muito JavaScript e autenticadas, nas quais scripts frágeis falham. Quando encontra algo que não possui — como um formulário de login — ele pausa e pede informações em vez de adivinhar ou falhar. Você pode definir interactive: true para fornecer credenciais ou outros dados confidenciais sob demanda, e as proteções mantêm o agente dentro das ações que você permite.
A API transmite eventos de tarefa via SSE enquanto o agente trabalha, permitindo que você acompanhe o progresso em tempo real. Quando a tarefa é concluída, você recebe uma resposta final limpa — não dados brutos da página. O modo interativo permite que você forneça campos de formulário no meio da tarefa, tornando-o seguro para fluxos autenticados sem nunca armazenar suas credenciais.
"O Tabstack lê a árvore de acessibilidade em vez de tirar capturas de tela, então cada ação custa uma fração do que os agentes baseados em visão gastam."
Esta é a principal diferença arquitetônica. A maioria dos agentes de automação de navegador envia uma captura de tela de página inteira a cada etapa, queimando milhares de tokens de visão por ação. A abordagem de árvore de acessibilidade do Tabstack reduz o consumo de tokens em 60 a 80%, o que se traduz diretamente em custos mais baixos em escala. Combinado com o fato de que o navegador e o modelo são totalmente gerenciados (nada para hospedar, sem teto de concorrência), torna a automação de alto volume economicamente viável pela primeira vez.
Você precisa automatizar tarefas web de várias etapas em páginas que não controla — fazer reservas, preencher formulários, extrair dados de sites com muito JavaScript — e deseja evitar o custo e a complexidade de montar uma pilha de automação de navegador. O Tabstack é especialmente atraente se você está escalando a automação e os custos de tokens dos agentes baseados em captura de tela estão consumindo seu orçamento. Também é uma boa opção se você precisar de um humano no circuito para fluxos autenticados ou operações confidenciais.
Outras ferramentas que você pode considerar
Dê ao seu agente de IA um fluxo de produto para gravar. O Slideshot conduz seu aplicativo web pelo MCP, captura o passo a passo e retorna um vídeo de demonstração polido e um GIF com zooms, movimento do cursor e animação de introdução personalizada. Sem gravação manual ou edição.
O Point MCP Bridge se conecta a qualquer API REST, GraphQL, SOAP ou gRPC. Ele gera automaticamente definições de ferramentas MCP com esquemas tipados, autenticação, limitação de taxa e processamento de respostas. Seus agentes LLM acessam APIs corporativas por meio de uma única interface padrão.
O Supercut MCP concede aos seus assistentes de IA/codificação acesso com permissões a gravações, incluindo pesquisa semântica, transcrições, quadros, comentários, reações e muito mais.
Octopoda é uma camada de infraestrutura de código aberto que oferece aos agentes de IA memória persistente, detecção automática de loops e observabilidade completa. Os agentes esquecem tudo entre as sessões. Octopoda resolve isso com uma API de lembrar/recuperar que sobrevive a reinicializações, falhas e implantações. O sistema de detecção de loops monitora 5 sinais para identificar agentes presos repetindo a si mesmos antes que eles queimem seu orçamento de API, com estimativa de custo em tempo real mostrando exatamente quanto cada loop desperdiça. Um painel integrado exibe a pontuação de saúde de cada agente, um explorador de memória com histórico de versões, um registro de auditoria que registra cada decisão com justificativa, e uma reprodução de linha do tempo que permite percorrer passo a passo tudo o que seu agente fez. Funciona com LangChain, CrewAI, AutoGen e OpenAI Agents SDK com integrações de uma linha. Roda localmente com SQLite ou conecta-se à nuvem com uma variável de ambiente. Camada gratuita, licenciado sob MIT. 177 inscrições, 120 estrelas no GitHub, zero gastos com marketing.
Criador
blueprint_b
Loading comments…