Skip to content

浏览器自动化(browser)

browser 工具基于 Chromedp(真实浏览器渲染),让智能体能够打开网页、截图、理解页面、自动操作表单,并抓取内容。

版本:个人版与企业版均支持。桌面操控(computer_use)为个人版独有,见文末。

支持的动作(action)

action说明
read读取当前页面正文 / 结构化内容
screenshot对当前页面截图
snapshot获取页面可访问性快照(SoM,元素树)
act执行操作,子操作包括 click / type / scroll / navigate / submit
vision基于截图做视觉理解(配合多模态模型)

后端路由:/api/v4/browser/{screenshot,read,act,snapshot,self-test,cast}cast 为 WebSocket 实时投屏)。

能做什么

  • 打开多个网页并并发抓取、合并内容
  • 填写表单、点击按钮、提交(基于真实渲染,而非纯 HTTP 模拟)
  • 保持登录态(在会话有效期内复用同一浏览器上下文)
  • 对页面截图后交给多模态模型理解布局

限制(重要)

  • 没有 PDF 导出:当前版本 browser 工具不支持 PrintToPDF / 导出 PDF。
  • 会话不持久:浏览器会话 TTL 仅 5 分钟、上限 50 个,超出会淘汰最老的会话;不能长期"保持登录",无 cookie / UserDataDir 持久化。
  • 降级:若 Chromedp 不可用,会自动降级为 HTTP GET 纯文本抓取(仅能拿到原始 HTML 文本)。
  • 需要本地或远程 Chromedp 可访问(默认通过 LYNCORE_BROWSER_API_BASE,缺省 http://127.0.0.1:19824)。

桌面操控(computer_use)

个人版额外提供桌面 AI 操控:AI 读取屏幕截图、理解界面、自动点击与输入。

  • 该能力仅在**个人版(Lite)**构建中注册
  • 需要另装第三方 cua-driverpip install cua-driver),未安装时返回 501
  • 企业版不含桌面操控模块(出于多租户安全考虑)

不要把"浏览器自动化"和"桌面操控"混为一谈:前者操作网页,后者操作整个操作系统界面,且依赖外部驱动。