CODE-VCLI SKILL

安装 code-vcli
视觉识别 Skill

让无多模态能力的 AI 编码模型「看见」屏幕:本地 OCR、VLM 与受 token 预算保护的 Mix。

快速开始

请将下面的指令发给 Agent

请使用 npx skills add GuSheng107/code-vcli --skill code-vcli -g 安装该 Skill,并引导用户完成 vcli init 初始化(工作区下会自动创建 files/ 文件夹);之后建议把截图放到 files/ 统一管理,用 vcli run <files/截图> --json 进行识别。

下载 ZIP包含 code-vcli Skill
查看两种安装方式
MODES

三种识别模式

根据需求选择 OCR、VLM 或 Mix;超长 OCR 不会无上限进入模型上下文。

VLM视觉理解

VLM 模式(Qwen2.5-VL)

为无视觉 Agent 返回纯视觉事实说明,并分别附加布局、元素与批注结构。需要 GPU;最低显存建议从 A2 的 4GB 起。

vcli run ./image.png --vlm --json
  • A1/A2/B1/B2/C1/C2 六个模型与量化组合
  • text/summary 不混入运行元信息;annotations 为额外批注结构
  • Apple/AMD 使用 BF16;NF4 仅 Windows/Linux NVIDIA
MIX先定位再理解

Mix 模式(OCR + VLM)

OCR 与 VLM 顺序执行;OCR 完成后释放资源,只注入 token 预算内的压缩上下文。

vcli run ./image.png --mix --json
  • 顺序执行:OCR → 释放 → VLM
  • 默认最多注入 16,384 OCR tokens,完整结果另存 artifact
  • 运行时可选 CPU OCR + GPU VLM 或全 GPU Mix
本地推理,图片不上传

推理完全在本地完成,无遥测。VLM 可选 3B/7B/32B 的 BF16 或 bitsandbytes NF4;CLI 会按显存与平台推荐,并在下载前阻止不兼容组合。模型下载支持 Hugging Face、hf-mirror 和 ModelScope 备用源。

十万字符级网页/表格先运行 OCR JSON,只读取相关区段,再用 --vlm -p 提问。Mix 会自动去重、空间抽样和限制 tokens,并返回完整 OCR artifact 路径。

INSTALL

安装 Skill

任选一种方式安装,然后完成首次配置。

方式一

npx 安装

一行命令全局安装 Skill。

npx skills add GuSheng107/code-vcli --skill code-vcli -g
方式二

ZIP 安装

下载后解压,将 code-vcli 文件夹放入所用 AI Agent 的 skills 目录(具体位置由 Agent 工具决定)。

下载 ZIP包含 code-vcli Skill
下一步

首次配置

安装 CLI 后运行 vcli init 初始化视觉模型环境(创建 venv、选计算模式、下载模型),并在工作区下自动创建 files/ 文件夹用于存放截图,之后即可开始识别。

文件结构

code-vcli/
└── SKILL.md

通过 npx skills add 安装会自动放入对应 Agent 的 skills 目录;ZIP 手动安装时放入所用 Agent 的 skills 目录即可。模型缓存:~/.code-vcli/models/。工作区:~/.code-vcli/ 或自定义路径,截图建议放到工作区下的 files/

已复制