Agent Vision Toolkit:给文本型 coding agent 增加视觉工具层
Agent Vision Toolkit:给文本型 coding agent 增加视觉工具层
为什么重要
Agent Vision Toolkit 的价值不是“又一个 OCR 工具”,而是把视觉能力封装成 coding agent 可调用的工具层与 skill:图片问答、OCR、截图理解、视觉定位、image-to-SVG,并提供 Codex、Claude Code、OpenCode、Pi 等接入路径。对 Hermes 来说,它直接补上 Agentic-Coding 和 External-Agent-Skills-Design-Patterns 的一个常见盲点:很多工程任务的证据并不在文本里,而在截图、报错 UI、设计稿、图表和坐标位置里。
机制 / 一阶原理
文本模型在没有视觉工具时,会把图像输入退化成“不可观察状态”;agent 只能要求用户转述,或者基于文件名/上下文猜测。Agent Vision Toolkit 的机制是把视觉任务拆成窄工具:glance 用于面向问题的图像描述,OCR 用于文字抽取,grounding 用于定位屏幕元素,image-to-SVG 用于结构化重建。skill 层负责告诉 agent 何时选择哪类视觉工具,而可选的本地代理/扩展层让某些 agent 能透明处理粘贴图片。
一阶原理是:agent 的能力上限常由 observation surface 决定。与其让 LLM“想象截图”,不如把图像转成可引用、可验证的文本/坐标/结构证据,再进入普通 coding/debug/design loop。
与现有 wiki 的关系
它补充 Context-Engineering 的“上下文类型”边界:上下文不只是 markdown、代码和日志,也包括视觉证据。它也和 Assay:AI artifact 的可复查评估框架 形成 admission 关系:视觉工具/skill 有更高权限和更宽输入面,进入 Hermes 前应至少经过静态读取、样例图片 dry-run、输出质量和隐私边界检查。
与 SWE-Touch:用户中途干预与共享工作区漂移 benchmark 类似,它把真实协作中的非文本状态纳入 agent loop;不同的是 SWE-Touch 测共享工作区变化,Agent Vision Toolkit 提供视觉观察能力。
对 Hermes / llm-wiki 的可执行启发
- 对截图型任务建立固定分流:错误截图走诊断,代码截图走 OCR,UI 实现差异走 UI diff,普通图片问答走视觉分析;不要把所有图像都交给同一通用 prompt。
- 外部视觉 skill 的 admission 字段应包括:是否上传图片到外部服务、是否保存图像、是否支持本地模型/API 切换、输出是否包含坐标证据、失败时是否明确“不确定”。
- llm-wiki ingest 可以把图像来源页面的 raw asset 与文字页绑定,避免未来只剩摘要而找不到原图证据。
失败模式 / 边界条件
视觉工具会引入两类新风险:第一,OCR/grounding 错误可能比文本错误更隐蔽,因为 agent 会把坐标或抽取文字当事实;第二,截图可能包含隐私、密钥、客户数据。对于 GUI 自动操作,视觉定位还会受到分辨率、缩放、主题、窗口遮挡影响。因此它适合作为 observation layer,不应替代最终的 DOM/API/文件级验证。
深度判断
评分:relevance 5/5,novelty 4/5,durability 4/5,actionability 5/5,source-quality 3/5,depth-potential 4/5。值得晋升,因为它提供了可复用的 multimodal observation workflow,而不是单一演示;但当前依据主要来自 README,confidence 保持 medium。
写入记录
- 2026-08-06 09:00 CST:新增 Agent Vision Toolkit 来源页,聚焦文本型 agent 的视觉观察层、Hermes 图像任务分流和外部视觉 skill admission。