
Loading comments…
制作者
meowbyte
访问网站
scrapr-wlist.vercel.app
项目信息
产品关键词
成就
SCRAPR 是一款网页数据提取 API,它能够直接从网站内部网络请求中捕获结构化的 JSON 数据——无需渲染浏览器或使用脆弱的 DOM 选择器。通过重放网站加载自身数据时发出的精确 HTTP/XHR 调用,SCRAPR 可在 200 毫秒内输出干净、可直接用于 AI 的数据。目前处于早期 MVP 阶段,已有超过 835 名工程师在等待名单上。
SCRAPR 拦截并重放网站用于填充自身界面的相同 HTTP/XHR 调用。这消除了浏览器启动时间和渲染延迟,平均提取速度达到 89 毫秒——比基于 Puppeteer 的解决方案快 10 到 100 倍。
类型、键和数据结构会根据每个 API 响应自动推断。字符串、数组和数字在输出 JSON 中保持正确类型,可直接用于 LLM 上下文、向量存储或代理内存。
由于 SCRAPR 针对的是内部数据 API 而非 DOM 元素,因此当网站重新设计 CSS 时,提取管道不会中断。底层数据端点的变化频率要低得多,从而将持续维护工作降至接近零。
超过 437 个活跃节点遍布 190 多个国家/地区,提供全球覆盖和 99.9% 的成功率。该服务支持批量提取、Webhook 通知和异步任务处理,适用于大规模数据操作。
"永不失效的提取层。"
SCRAPR 重新定义了网页抓取,将每个网站视为其自身的 API。它并非模拟用户浏览页面,而是捕获网站已经发送给自身的结构化数据。这种方法能产生更快、更可靠的结果,并消除了传统抓取工具中不断更新选择器的循环。输出的是干净的 JSON——无需 HTML 解析,无需正则表达式清理,只有可直接用于 AI 管道的类型化数据。
你正在构建依赖新鲜、结构化网页内容的 AI 代理、RAG 系统或数据管道。如果你曾因缓慢的无头浏览器、脆弱的 CSS 选择器或传统抓取工具的维护负担而感到沮丧,SCRAPR 提供了一种根本不同的方法。它尤其适合需要大规模提取数据的团队——批量端点和 Webhook 支持已处于 alpha 阶段,REST API 在 v1 版本中保持稳定。
其他您可能感兴趣的工具