给浏览器装上毫秒级决策大脑。browser-use 团队开源的超高速浏览器智能体:页面被渲染成编号控件表,Jev 模型单次请求同时选出操作与目标元素,仅在填文字时调用小模型,默认不看截图、零脚本驱动,官方实测 7.1 秒完成 Google Flights 跨国机票搜索,浏览器调用次数从上千降到百余,源码小到可通读。 定价:免费开源(需自备模型 API Key)。编辑评分:⭐ 4.5。
Jev Ultrafast 是什么?
Jev Ultrafast 是 browser-use 团队开源的超高速浏览器智能体:给它一个自然语言目标,它把页面渲染成一张编号控件表,由 TypeSafe 的 Jev 决策模型在单次请求里同时选出操作与目标元素,只有需要填文字时才调用小模型生成文本。默认循环不看截图、每个决策周期只发一次模型请求,官方演示 7.1 秒在 Google Flights 上完成苏黎世飞伦敦的单程搜索,浏览器协议调用次数从上千次降到百余次。对被「截图加循环」拖慢的传统浏览器 Agent 来说,它展示了另一种快法,项目还配套开放了 Cloud 候补名单。
核心功能
- 动态编号控件表:每次观察生成带角色、名称与当前值的元素清单,模型从兼容目标中选择,输出永远指向真实 DOM 节点。
- 单请求双决策:操作与目标在同一请求里投机式产出,CLICK 只会用点击目标执行,省掉来回往返。
- 按需文本生成:仅 TYPE_TEXT 时调用小模型写文字,其余操作零生成,模型输出不允许变成选择器、坐标或脚本。
- 执行前校验:点击前检查文档新鲜度、表单状态与遮挡情况,动画不触发重复预测。
- 本地可视化 Inspector:跑在本地网页端,逐条展示编号元素、操作概率与已执行动作,可单步暂停观察。
- Python 库调用:几行代码即可把 Agent 嵌进自己的脚本,同一种策略可跑航班、维基百科、酒店筛选等任务。
版本/套餐对比
项目本体开源免费,仓库结构小巧到可以通读:核心只有 Agent 循环、DOM 快照、浏览器连接与模型接口几个文件。运行需要自备两把钥匙——TypeSafe Jev 的策略模型 Key 与一个 OpenAI 兼容的文本模型 Key(示例用 Mercury,也支持 Gemini、GLM、DeepSeek 等),浏览器通过 Browser Harness 连接本机 Chrome。官方同时开放了 Browser Use Cloud 的候补名单,未来会提供托管版超高速 Agent。简单说:今天想用就要自己配 Key 本地跑,之后等云版可以省掉环境搭建;两种形态的决策内核相同。
值不值得用?
它的价值在于重新定义了浏览器 Agent 的速度预算:不做截图、不做多轮往返,把一次操作压到一个网络来回,实测中位任务时间与协议调用都有大幅下降,且每步目标都从观察到的节点解析,稳定性有依据。适用边界也坦白写着:DOM 读取覆盖常见 HTML 与 ARIA 控件,阴影 DOM、iframe、画布、上传、弹窗标签页等仍在 MVP 之外;视频是单任务多次重复的结果,不是普适基准。如果你要批量做表单、搜索、比价这类结构化网页任务,它值得直接上手;要做复杂站内多步流,还得等成熟。
从机制设计的角度,单请求双决策的投机式执行是它速度的真正来源:操作与目标在同一个前向里产出,网络往返被压到一个来回,这种思路与「先出操作再追问目标」的传统两段式形成鲜明对比,对做低延迟 Agent 系统的工程师有直接的参考价值。复现它的效果时建议留意测量边界:计时从页面观察之后开始,且是同一任务在固定配置下的多次重复,换到自己的页面与任务上,吞吐与成功率都需要重新基准化,别把演示数字直接当成预算依据。
使用建议
- 克隆仓库跑本地 Inspector,先看一次完整决策流再写自己的任务。
- 目标描述里写清停止条件,让 DONE 判断更可靠。
- 用 examples 里的脚本改 URL 与目标,从简单任务起步。
- 关注 Cloud 候补名单,不想管 Chrome 调试就等托管版。
适合谁用?
- 推荐:需要程序化操作网页的开发者、做 RPA 与自动化脚本的团队、研究浏览器 Agent 架构的工程师。
- 可考虑:非技术用户可先等 Cloud 版再入手。
- 不推荐:需要处理上传、弹窗、iframe 等复杂页面形态的任务,当前 MVP 覆盖不了。