
Manifest 能将任意网页转化为结构化 JSON 地图,清晰标注 AI 代理可以点击、填写和提交的内容。仅需一次 API 调用,无需脆弱的 CSS 选择器。每个操作都附带已解析的 CSS/角色定位器,以及一个 requires 字段,用于编码元素间的依赖关系(例如“先选择套餐,此按钮才可点击”)。这是无障碍 ARIA 快照无法提供的信息。内置 Python SDK、LangChain 支持及 MCP 服务器。专为交付浏览器代理的开发者打造。
Manifest 是一个 API,能将任何网页转化为结构化的 JSON 映射,其中包含 AI 智能体可以点击、填写和提交的交互元素。它不依赖脆弱的 CSS 选择器或截图,而是读取页面的无障碍树,并与 DOM 交叉引用,生成清晰的操作清单。每个操作都附带已解析的定位器和一个 requires 字段,该字段编码了元素之间的依赖关系——例如,“在选择计划之前,此按钮不可点击”。这为智能体提供了可靠、机器可读的蓝图,明确它们可以在页面上实际执行哪些操作。
清单中的每个交互元素都包含一个 requires 字段,用于编码操作之间的依赖关系。这告诉智能体在按钮可点击或表单可提交之前,必须完成哪些字段或步骤——这是无障碍快照本身无法提供的上下文信息。
每个操作都附带已解析的 CSS 和角色定位器,消除了开发者编写或维护选择器的需求。API 处理了识别元素的脆弱工作,因此即使页面重新设计,智能体也能可靠地找到并与之交互。
API 返回一个干净、可预测的 JSON 清单,包含页面上的每个按钮、表单和输入,以及它们的类型、必填字段、占位符和禁用状态。这种结构化格式让智能体能推理可用操作,并就下一步行动做出明智决策。
Manifest 提供 Python SDK、LangChain 支持和 MCP 服务器,使其易于集成到现有的智能体框架和不同编程环境的工作流中。
“Manifest 是告诉智能体点击、填写和提交什么的层——以及哪些是继续操作前必须完成的。”
虽然浏览器工具让智能体访问页面,内容工具提取文本,但 Manifest 填补了缺失的一层:可操作的情报。它不仅告诉智能体页面上有什么——还告诉它可以在那里做什么、每个操作需要什么,以及必须先满足哪些依赖关系。这将网页从视觉或文本文档转变为结构化的操作空间,智能体可以自主导航。
你正在构建需要与真实网页可靠交互的浏览器智能体,且不希望依赖脆弱的选择器或基于截图的猜测。如果你的智能体必须处理表单、多步骤工作流或频繁变化的页面——并且你希望它们像人类一样推理依赖关系和必填字段——那么 Manifest 尤其有价值。
其他您可能感兴趣的工具
用日常英语描述/自动化一个任务,它就能驱动真实浏览器执行:浏览网站、完成多步骤操作流程、填写表单、抵达仅通过交互才能渲染的页面。结果通过一次API调用流式返回。这是一个可直接调用的API,而非需要安装的框架。内置浏览器和LLM,无需托管,无并发上限。基于无障碍树(Accessibility-tree)的自动化方案比基于截图的智能体节省60%至80%的令牌消耗。由Mozilla构建。临时性处理,不会用您的数据进行训练。
全球的计算能力建设速度已无法满足AI需求的增长。因此,我们另辟蹊径。ZeroGPU是一种AI基础设施,由运行在混合边缘网络上的小型语言模型驱动,复用现有计算资源。并非所有任务都需要前沿模型。我们专为边缘场景优化的定制模型,运行速度快10倍、成本低50%,可将70%-80%的生产任务分流至小型模型,同时保持前沿级别的准确性。
Loading comments…
制作者
modemfox
访问网站
omfang.io
项目信息
产品关键词