搞自动化和爬虫的人,经常被「网站结构一变脚本就废」「登录态难维护」「复杂跨站流程难写」折磨。
GitHub 上有个项目叫 Index(由 AI 开发平台 Laminar 团队推出),定位是开源浏览器 Agent:用自然语言描述任务,它就能像真人一样在浏览器里点击、填表、抓数据,甚至完成跨站点的一整套操作,本质上是把网页变成可调用的能力层。
项目地址:https://github.com/lmnr-ai/index
需要先说清楚:该仓库已在 2025 年左右被官方归档为只读,不再维护更新。 下面介绍的是它当时的设计与能力,适合作为技术参考,而不是直接当作长期生产方案。
当时主打的能力
- 自然语言驱动浏览器
终端里说一句话,Agent 负责在页面上点按、滚动、提取信息、填写表单。 - WebVoyager 测试约 92% 准确率
在公开基准上表现不错,属于当时开源浏览器 Agent 里较受关注的一档。 - 使用方式简单
pip install 后执行 index run,可在交互式 CLI 里直接下指令。 - 支持本地 Chrome
加 --local-chrome 参数,可复用你已登录的账号状态,减少重复登录。 - 多模态视觉推理
支持 Claude、Gemini 等带视觉能力的模型,适合需要「看页面」再决策的任务。 - 会话回放与调试
配合 Laminar 可做步骤追踪和录屏,方便排查 Agent 在哪一步走偏。 - 结构化输出与表格场景
支持按 Schema 提取数据,也能完成「去网站抓数据写进 Google Sheets」这类流程。
它解决的核心痛点
传统爬虫/自动化脚本:
页面一改就挂、验证码和登录难处理、跨多站流程要手写大量逻辑。
浏览器 Agent 的思路是:让模型根据实时页面状态决策下一步动作,把「写死规则」变成「目标导向」。Index 在这条路上做了较完整的工程化尝试(CLI、本地浏览器、可观测性、结构化输出)。
现在怎么看待这个项目?
- 参考价值仍在
架构思路、CLI 交互、本地 Chrome 复用、与可观测平台结合,对后来做浏览器 Agent 的人仍有借鉴意义。 - 不建议当生产主力
仓库已归档,依赖、模型和网站反爬都在快速变化,直接拿来跑业务风险较高。 - 同类方向仍在演进
浏览器 Agent、Computer Use、各类开源/商业方案都在更新,选型时优先看当前维护状态、登录态安全策略和失败可观测性。
使用与安全提醒
即便是活跃项目,浏览器 Agent 也要注意:
- 会真实操作你的浏览器会话,权限和账号安全要严格控制
- 遵守目标网站服务条款与法律法规,避免违规采集
- 复杂任务失败率真实存在,关键操作需人工复核
- API 费用(模型调用)和稳定性要自己评估
小结
Index 曾经把「用一句话让 Agent 操作网页」这件事做得比较完整,也在基准上拿到过不错成绩。它已经停止维护,但作为开源浏览器 Agent 的一个阶段性作品,值得技术向的朋友了解其设计。
如果你正在做自动化或 Agent 上网能力,更建议关注当前仍在活跃维护的方案,同时把 Index 的文档和代码当历史参考。工具会过时,把网页变成可靠可编程接口这个方向,还会继续往前走。




No comments yet