

プレーンな英語でタスクを指示/自動化すると、実際のブラウザを操作して、サイトのナビゲーション、複数ステップのフローのクリック、フォームへの入力、インタラクション後にのみ表示されるページへのアクセスなどを実行します。結果は1回のAPI呼び出しでストリーミング返却されます。これはインストールするフレームワークではなく、呼び出すAPIです。ブラウザとLLMが含まれており、ホスティング不要、同時実行数の上限もありません。アクセシビリティツリーによる自動化は、スクリーンショットベースのエージェントと比較して60~80%少ないトークンで済みます。Mozilla製。エフェメラル(一時的)で、お客様のデータで学習することはありません。
Loading comments…
プロジェクト情報
製品キーワード
Tabstack Browser Automation は、プレーンな英語でWebタスクを記述し、実際のブラウザで実行させるためのAPIです。「SFOからJFKへの最安直行便で、ラッシュアワーを避け、カートに追加する」といったタスクを渡すと、Tabstackが操作対象外のページ上でナビゲート、クリック、フォーム入力、複数ステップのフローを完了します。ブラウザとLLMは両方ともTabstackのインフラ上で動作するため、APIを1回呼び出すだけで完了結果が返ってきます。Mozillaによって開発され、スクリーンショットではなくアクセシビリティツリーを使用し、データは一時的に保持され、入力内容が学習に使用されることはありません。
Tabstackはブラウザ自動化スタック全体を排除します。インストールするフレームワーク、組み込むモデル、ホストするブラウザは一切不要です。プレーンな言語のタスクとURLを指定して/automateを呼び出すだけで、サービスがナビゲーション、クリック、フォーム入力、結果抽出のすべてを処理し、作業中にイベントをストリーミングで返します。
Tabstackは、アクションごとに全ページ画像を送信する代わりに(これにより数千のビジョントークンを消費します)、ブラウザのアクセシビリティツリーを読み取ります。このコンパクトな構造化テキスト(ボタン「検索」、テキストボックス「メールアドレス」、リンク「料金プラン」)は、スクリーンショットベースのエージェントと比較して、アクションあたり60~80%少ないトークンを使用します。大規模運用では、これは単なる微最適化ではなく、実際のコスト差となります。
エージェントは、脆弱なスクリプトでは対応できない、JavaScriptが多用され動的で認証が必要なページでも動作します。ログインフォームなど、持っていない情報に遭遇した場合は、推測したり失敗したりする代わりに一時停止して入力を求めます。interactive: trueを設定することで、認証情報などの機密データをオンデマンドで提供でき、ガードレールによりエージェントが許可されたアクション内に留まるように制御できます。
APIはエージェントの作業中にSSEを介してタスクイベントをストリーミングするため、リアルタイムで進捗を確認できます。タスクが完了すると、生のページデータではなく、明確な最終回答が得られます。インタラクティブモードでは、タスクの途中でフォームフィールドを提供できるため、認証情報を保存することなく、認証フローを安全に実行できます。
「Tabstackはスクリーンショットを撮る代わりにアクセシビリティツリーを読み取るため、各アクションのコストはビジョンベースのエージェントの数分の一です。」
これが中核的なアーキテクチャ上の違いです。ほとんどのブラウザ自動化エージェントは、各ステップで全ページのスクリーンショットを送信し、アクションごとに数千のビジョントークンを消費します。Tabstackのアクセシビリティツリーアプローチはトークン消費を60~80%削減し、これは大規模運用において直接的なコスト削減につながります。ブラウザとモデルが完全に管理されている(ホスト不要、同時実行数の上限なし)ことと相まって、初めて大量自動化を経済的に実現可能にします。
自分が管理していないページで多段階のWebタスク(予約、フォーム入力、JavaScript多用サイトからのデータ抽出)を自動化する必要があり、ブラウザ自動化スタックの構築にかかるコストと複雑さを回避したい方。特に、自動化を拡大しており、スクリーンショットベースのエージェントによるトークンコストが予算を圧迫している場合に最適です。また、認証フローや機密操作にヒューマンインザループが必要な場合にも強力な選択肢となります。
メーカー
blueprint_b
Loading comments…
検討すべき他のツール