
Manifest는 모든 웹페이지를 AI 에이전트가 클릭, 입력, 제출할 수 있는 구조화된 JSON 맵으로 변환합니다. 단 한 번의 API 호출로, 깨지기 쉬운 선택자는 필요 없습니다. 모든 액션에는 해결된 CSS/role 로케이터와 함께 요소 간의 의존성을 인코딩하는 requires 필드가 포함됩니다(예: "이 버튼을 클릭할 수 있게 되기 전에 요금제를 선택하세요"). 이는 컨텍스트 aria 스냅샷이 제공하지 않는 정보입니다. Python SDK, LangChain 지원, MCP 서버가 포함되어 있습니다. 브라우저 에이전트를 배포하는 모든 사람을 위해 제작되었습니다.
Manifest는 모든 웹페이지를 AI 에이전트가 클릭, 입력, 제출할 수 있는 상호작용 요소의 구조화된 JSON 맵으로 변환하는 API입니다. 취약한 CSS 선택자나 스크린샷에 의존하는 대신, 페이지의 접근성 트리를 읽고 DOM과 상호 참조하여 깔끔한 액션 매니페스트를 생성합니다. 각 액션에는 해결된 로케이터와 요소 간의 의존성을 인코딩하는 requires 필드가 포함됩니다. 예를 들어, "이 버튼을 클릭할 수 있게 되기 전에 요금제를 선택하세요"와 같은 정보를 제공합니다. 이를 통해 에이전트는 페이지에서 실제로 수행할 수 있는 작업에 대한 신뢰할 수 있는 기계 판독 가능 청사진을 얻을 수 있습니다.
매니페스트의 모든 상호작용 요소에는 액션 간의 의존성을 인코딩하는 requires 필드가 포함됩니다. 이는 에이전트에게 버튼을 클릭할 수 있게 되거나 양식을 제출할 수 있게 되기 전에 완료해야 하는 필드나 단계를 알려줍니다. 이는 접근성 스냅샷만으로는 제공되지 않는 컨텍스트입니다.
각 액션에는 해결된 CSS 및 역할 로케이터가 포함되어 있어 개발자가 선택자를 작성하거나 유지 관리할 필요가 없습니다. API가 요소 식별의 취약한 작업을 처리하므로 에이전트는 페이지 재설계 후에도 요소를 안정적으로 찾고 상호작용할 수 있습니다.
API는 페이지의 모든 버튼, 양식, 입력과 해당 유형, 필수 필드, 플레이스홀더, 비활성화 상태를 포함하는 깔끔하고 예측 가능한 JSON 매니페스트를 반환합니다. 이 구조화된 형식을 통해 에이전트는 사용 가능한 액션에 대해 추론하고 다음에 수행할 작업에 대한 정보에 기반한 결정을 내릴 수 있습니다.
Manifest는 Python SDK, LangChain 지원, MCP 서버와 함께 제공되어 다양한 프로그래밍 환경의 기존 에이전트 프레임워크 및 워크플로우에 쉽게 통합할 수 있습니다.
"Manifest는 에이전트에게 무엇을 클릭하고, 입력하고, 제출할지, 그리고 진행하기 전에 무엇이 필수인지 알려주는 계층입니다."
브라우저 도구는 에이전트에게 페이지에 대한 접근 권한을 제공하고 콘텐츠 도구는 텍스트를 추출하는 반면, Manifest는 누락된 계층인 실행 가능한 인텔리전스를 채웁니다. 단순히 페이지에 무엇이 있는지만 알려주는 것이 아니라, 그곳에서 무엇을 할 수 있는지, 각 액션에 무엇이 필요한지, 먼저 충족해야 할 의존성이 무엇인지 알려줍니다. 이를 통해 웹페이지를 시각적 또는 텍스트 문서에서 에이전트가 자율적으로 탐색할 수 있는 구조화된 액션 공간으로 전환합니다.
취약한 선택자나 스크린샷 기반 추측 없이 실제 웹페이지와 안정적으로 상호작용해야 하는 브라우저 에이전트를 구축하는 경우입니다. Manifest는 특히 에이전트가 양식, 다단계 워크플로우, 자주 변경되는 페이지를 처리해야 하고, 사람처럼 의존성과 필수 필드에 대해 추론하도록 만들고자 할 때 유용합니다.
고려해볼 만한 다른 도구
Loading comments…
제작자
modemfox
웹사이트 방문
omfang.io
프로젝트 정보
제품 키워드