Code on a screen with a dark theme

Index:把浏览器变成可调用 API 的开源浏览器 Agent(已归档)

介绍开源浏览器 Agent 项目 Index(Laminar 团队):用自然语言驱动浏览器完成点击、抓取、填表与跨站任务,曾在 WebVoyager 达到约 92% 准确率。文章说明其核心能力,并明确仓库已归档、仅适合作为技术参考。

搞自动化和爬虫的人,经常被「网站结构一变脚本就废」「登录态难维护」「复杂跨站流程难写」折磨。

GitHub 上有个项目叫 Index(由 AI 开发平台 Laminar 团队推出),定位是开源浏览器 Agent:用自然语言描述任务,它就能像真人一样在浏览器里点击、填表、抓数据,甚至完成跨站点的一整套操作,本质上是把网页变成可调用的能力层。

项目地址:https://github.com/lmnr-ai/index

需要先说清楚:该仓库已在 2025 年左右被官方归档为只读,不再维护更新。 下面介绍的是它当时的设计与能力,适合作为技术参考,而不是直接当作长期生产方案。

当时主打的能力

  1. 自然语言驱动浏览器
    终端里说一句话,Agent 负责在页面上点按、滚动、提取信息、填写表单。
  2. WebVoyager 测试约 92% 准确率
    在公开基准上表现不错,属于当时开源浏览器 Agent 里较受关注的一档。
  3. 使用方式简单
    pip install 后执行 index run,可在交互式 CLI 里直接下指令。
  4. 支持本地 Chrome
    加 --local-chrome 参数,可复用你已登录的账号状态,减少重复登录。
  5. 多模态视觉推理
    支持 Claude、Gemini 等带视觉能力的模型,适合需要「看页面」再决策的任务。
  6. 会话回放与调试
    配合 Laminar 可做步骤追踪和录屏,方便排查 Agent 在哪一步走偏。
  7. 结构化输出与表格场景
    支持按 Schema 提取数据,也能完成「去网站抓数据写进 Google Sheets」这类流程。

它解决的核心痛点

传统爬虫/自动化脚本:
页面一改就挂、验证码和登录难处理、跨多站流程要手写大量逻辑。

浏览器 Agent 的思路是:让模型根据实时页面状态决策下一步动作,把「写死规则」变成「目标导向」。Index 在这条路上做了较完整的工程化尝试(CLI、本地浏览器、可观测性、结构化输出)。

现在怎么看待这个项目?

  • 参考价值仍在
    架构思路、CLI 交互、本地 Chrome 复用、与可观测平台结合,对后来做浏览器 Agent 的人仍有借鉴意义。
  • 不建议当生产主力
    仓库已归档,依赖、模型和网站反爬都在快速变化,直接拿来跑业务风险较高。
  • 同类方向仍在演进
    浏览器 Agent、Computer Use、各类开源/商业方案都在更新,选型时优先看当前维护状态、登录态安全策略和失败可观测性。

使用与安全提醒

即便是活跃项目,浏览器 Agent 也要注意:

  • 会真实操作你的浏览器会话,权限和账号安全要严格控制
  • 遵守目标网站服务条款与法律法规,避免违规采集
  • 复杂任务失败率真实存在,关键操作需人工复核
  • API 费用(模型调用)和稳定性要自己评估

小结

Index 曾经把「用一句话让 Agent 操作网页」这件事做得比较完整,也在基准上拿到过不错成绩。它已经停止维护,但作为开源浏览器 Agent 的一个阶段性作品,值得技术向的朋友了解其设计。

如果你正在做自动化或 Agent 上网能力,更建议关注当前仍在活跃维护的方案,同时把 Index 的文档和代码当历史参考。工具会过时,把网页变成可靠可编程接口这个方向,还会继续往前走。

No comments yet