← 返回藏书阁

agent-vision-toolkit:给文本 Agent 加“视觉 harness”

wiki/ai/sources/agent-vision-toolkit-vision-harness.md
分类:ai / sources · 更新:2026-08-17 09:05

agent-vision-toolkit:给文本 Agent 加“视觉 harness”

深度判断

值得深挖的原因不是“又一个多模态工具”,而是它把视觉能力从模型侧能力改写成 harness 侧能力:文本模型通过 CLI、技能和本地代理获得图片问答、长截图 OCR、UI 还原、GUI 自动化、像素 diff、前景提取、颜色分析等可组合视觉工具。这直接关系到 Harness-EngineeringContext-EngineeringExternal-Agent-Skills-Design-Patterns:能力不必全放在模型权重里,可以通过可验证工具面补齐。

机制 / 一阶原理

该项目把“看图”拆成两层。第一层是可由任何 shell-capable agent 调用的视觉 CLI;第二层是可选的本地 proxy / 原生插件,把粘贴图片和内置 image tool 接入同一套工具。这样,模型只需做意图识别和工具选择,图像理解、裁剪、OCR、截图、像素级比较等工作由外部工具承担。

这是一种能力外置化:把不可控的“模型是否原生多模态”转成可安装、可审计、可替换的工具契约。对 coding agent 尤其重要,因为 UI bug、长截图、设计稿还原、GUI 自动化常常不是纯文本上下文能可靠解决的问题。

和既有 wiki 的关系

  • 补强 Harness-Engineering:harness 不只是权限/流程控制,也可以是能力扩展层。
  • 补强 Context-Engineering:图片、截图、UI 状态是上下文来源;需要被转换成 agent 可消费的文本/结构化证据。
  • 补强 External-Agent-Skills-Design-Patterns:一个高质量 skill 应同时声明何时使用视觉工具、何时退回文本、如何验证输出。

对 Hermes / llm-wiki 的可执行启发

  1. 图片类 Feishu 输入或 UI 截图任务不应只靠通用 OCR;应按任务路由到 OCR、UI diff、数据图表理解、技术图理解等专门工具。
  2. wiki ingest 遇到截图型资料时,可把“视觉工具调用结果 + 原图路径 + 人类可追溯说明”作为 raw/source 的 provenance。
  3. skill 设计可以增加 capability manifest:输入模态、工具依赖、验证方式、失败时降级路径。

失败模式 / 边界

视觉工具链会引入三类风险:工具输出幻觉或误识别、代理/proxy 对隐私图片的额外暴露面、以及模型过度相信 OCR/视觉摘要。正式接入前应要求:保留原图、记录工具版本/参数、重要判断做二次验证;对包含隐私/凭证的截图默认只做本地处理。

写入记录

  • 2026-08-17 09:00 CST:从 GitHub README 深度入库,记录机制、与既有 wiki 概念的关系、Hermes/llm-wiki 可执行启发和失败模式。