OCR 模式(PP-OCRv6)
整图 OCR,速度快;JSON 只含全文、模式和引擎。适合文档、扫描件、纯文字图片。
vcli run ./image.png --json- CPU OpenVINO / GPU Torch CUDA 或 MPS
- 普通 OCR JSON 只返回全文;Web JSON 另含去重后的坐标与紧凑布局
- 可选
--web叠加 YOLO UI 元素检测
让无多模态能力的 AI 编码模型「看见」屏幕:本地 OCR、VLM 与受 token 预算保护的 Mix。
请将下面的指令发给 Agent
请使用 npx skills add GuSheng107/code-vcli --skill code-vcli -g 安装该 Skill,并引导用户完成 vcli init 初始化(工作区下会自动创建 files/ 文件夹);之后建议把截图放到 files/ 统一管理,用 vcli run <files/截图> --json 进行识别。
根据需求选择 OCR、VLM 或 Mix;超长 OCR 不会无上限进入模型上下文。
整图 OCR,速度快;JSON 只含全文、模式和引擎。适合文档、扫描件、纯文字图片。
vcli run ./image.png --json--web 叠加 YOLO UI 元素检测为无视觉 Agent 返回纯视觉事实说明,并分别附加布局、元素与批注结构。需要 GPU;最低显存建议从 A2 的 4GB 起。
vcli run ./image.png --vlm --jsonOCR 与 VLM 顺序执行;OCR 完成后释放资源,只注入 token 预算内的压缩上下文。
vcli run ./image.png --mix --json推理完全在本地完成,无遥测。VLM 可选 3B/7B/32B 的 BF16 或 bitsandbytes NF4;CLI 会按显存与平台推荐,并在下载前阻止不兼容组合。模型下载支持 Hugging Face、hf-mirror 和 ModelScope 备用源。
十万字符级网页/表格先运行 OCR JSON,只读取相关区段,再用 --vlm -p 提问。Mix 会自动去重、空间抽样和限制 tokens,并返回完整 OCR artifact 路径。
任选一种方式安装,然后完成首次配置。
code-vcli/
└── SKILL.md
通过 npx skills add 安装会自动放入对应 Agent 的 skills 目录;ZIP 手动安装时放入所用 Agent 的 skills 目录即可。模型缓存:~/.code-vcli/models/。工作区:~/.code-vcli/ 或自定义路径,截图建议放到工作区下的 files/。