浏览器自动化(browser)
browser 工具基于 Chromedp(真实浏览器渲染),让智能体能够打开网页、截图、理解页面、自动操作表单,并抓取内容。
版本:个人版与企业版均支持。桌面操控(computer_use)为个人版独有,见文末。
支持的动作(action)
| action | 说明 |
|---|---|
read | 读取当前页面正文 / 结构化内容 |
screenshot | 对当前页面截图 |
snapshot | 获取页面可访问性快照(SoM,元素树) |
act | 执行操作,子操作包括 click / type / scroll / navigate / submit |
vision | 基于截图做视觉理解(配合多模态模型) |
后端路由:/api/v4/browser/{screenshot,read,act,snapshot,self-test,cast}(cast 为 WebSocket 实时投屏)。
能做什么
- 打开多个网页并并发抓取、合并内容
- 填写表单、点击按钮、提交(基于真实渲染,而非纯 HTTP 模拟)
- 保持登录态(在会话有效期内复用同一浏览器上下文)
- 对页面截图后交给多模态模型理解布局
限制(重要)
- 没有 PDF 导出:当前版本
browser工具不支持 PrintToPDF / 导出 PDF。 - 会话不持久:浏览器会话 TTL 仅 5 分钟、上限 50 个,超出会淘汰最老的会话;不能长期"保持登录",无 cookie / UserDataDir 持久化。
- 降级:若 Chromedp 不可用,会自动降级为 HTTP GET 纯文本抓取(仅能拿到原始 HTML 文本)。
- 需要本地或远程 Chromedp 可访问(默认通过
LYNCORE_BROWSER_API_BASE,缺省http://127.0.0.1:19824)。
桌面操控(computer_use)
个人版额外提供桌面 AI 操控:AI 读取屏幕截图、理解界面、自动点击与输入。
- 该能力仅在**个人版(Lite)**构建中注册
- 需要另装第三方
cua-driver(pip install cua-driver),未安装时返回 501 - 企业版不含桌面操控模块(出于多租户安全考虑)
不要把"浏览器自动化"和"桌面操控"混为一谈:前者操作网页,后者操作整个操作系统界面,且依赖外部驱动。