modelscope.cn

ga_vision

视觉理解 Skill,支持文字识别(OCR)和图片理解,自动按优?

Installation

$ npx skills add https://modelscope.cn

Also in this package

Other skills from modelscope.cn · top by installs.

npx skills add https://modelscope.cn

Browse all from modelscope.cn

More details

Agent compatibility

Declared targets from SKILL.md / docs. Unmarked agents are not listed — the skill may still install via the CLI.

Claude Code Not declared
Cursor Not declared
Codex Not declared
GitHub Copilot Not declared
Windsurf Not declared
Gemini CLI Not declared
Cline Not declared
OpenCode Not declared

Skill metadata

Parsed from SKILL.md frontmatter.

Version1.0.0
LicenseMIT

Package contents

Files included with this skill beyond the listing page.

  • skill md SKILL.md 1,839 B

History

  1. First recorded snapshot · 0 installs

SKILL.md

ga_vision Skill

视觉理解 Skill,支持文字识别和图片理解,自动按优先级调度后端。

前置依赖

依赖 说明 安装方式
rapidocr_onnxruntime 必须,纯文字识别 pip install rapidocr_onnxruntime
mmx CLI 推荐,需 Token Plan 订阅 npm install -g mmx-cli
vision_api 备用,需魔搭 API Key 见下方配置说明

魔搭(ModelScope) API Key 配置

获取地址:https://modelscope.cn → 右上角头像 → API-KEY

# 方式1: 环境变量
export MODELSCOPE_API_KEY="your_token_here"

# 方式2: 创建配置
mkdir -p ~/.modelscope_env
echo "your_token_here" > ~/.modelscope_env/MODELSCOPE_TOKEN

优先级(自动调度)

优先级 后端 条件
1 RapidOCR pip install 后立即可用
2 mmx MiniMax npm install + Token Plan 订阅
3 vision_api 魔搭 API Key

使用方法

import sys
sys.path.insert(0, '/path/to/skills/ga_vision')
from ga_vision import ask_vision, ocr_image

# 文字识别(RapidOCR,最快)
text = ocr_image('/path/to/img.png')

# 图片理解(自动选最优后端)
result = ask_vision('/path/to/img.png', '描述图片内容')

API

ocrimage(imagepath: str) -> str

纯文字识别,返回识别到的文本内容。

askvision(imagepath: str, prompt: str = "描述图片内容") -> str

统一视觉理解入口,自动按优先级调度后端,返回理解结果。