运行时依赖
安装命令
点击复制技能文档
分类:提供者 Model Studio Qwen OCR 验证 mkdir -p output/aliyun-qwen-ocr python -m py_compile skills/ai/multimodal/aliyun-qwen-ocr/scripts/prepare_ocr_request.py && echo "py_compile_ok" > output/aliyun-qwen-ocr/validate.txt 通过标准:命令退出 0 且 output/aliyun-qwen-ocr/validate.txt 被生成。 输出和证据 在 output/aliyun-qwen-ocr/ 下保存请求负载、选定的 OCR 任务名称和归一化输出预期。 每次保存运行时保持相同的模型、图像源和任务配置。 当任务主要是文本提取或文档结构解析而不是广泛的视觉推理时,使用 Qwen OCR。 关键模型名称 使用以下确切模型字符串之一: qwen-vl-ocr qwen-vl-ocr-latest qwen-vl-ocr-2025-11-20 qwen-vl-ocr-2025-08-28 qwen-vl-ocr-2025-04-13 qwen-vl-ocr-2024-10-28 选择指南: 使用 qwen-vl-ocr 进行稳定通道。 仅当您明确需要最新的 OCR 行为时,使用 qwen-vl-ocr-latest。 当您需要基于 Qwen3-VL OCR 升级的可复制文档解析时,固定 qwen-vl-ocr-2025-11-20。 先决条件 安装依赖项(推荐在 venv 中): python3 -m venv .venv . .venv/bin/activate python -m pip install requests 在环境中设置 DASHSCOPE_API_KEY 或在 ~/.alibabacloud/credentials 中添加 dashscope_api_key。 归一化接口(ocr.extract) 请求图像(字符串,必需):HTTPS URL、本地路径或 data: URL。 模型(字符串,选项):默认 qwen-vl-ocr。 提示(字符串,选项):当您需要自定义提取说明时使用。 任务(字符串,选项):内置 OCR 任务。 任务配置(对象,选项):内置任务的配置,例如提取字段。 启用旋转(布尔,选项):默认 false。 最小像素(整数,选项) 最大像素(整数,选项) 最大令牌(整数,选项) 温度(浮点数,选项):建议保持在默认/低值附近。 响应文本(字符串):提取的文本或结构化 markdown/html 风格输出。 模型(字符串) 使用情况(对象,选项) 内置 OCR 任务 在任务中使用以下值之一: text_recognition key_information_extraction document_parsing table_parsing formula_recognition multi_lan advanced_recognition 快速入门 自定义提示: python skills/ai/multimodal/aliyun-qwen-ocr/scripts/prepare_ocr_request.py \ --image "https://example.com/invoice.png" \ --prompt "以 JSON 格式提取卖家名称、发票日期、金额和税号。" 内置任务: python skills/ai/multimodal/aliyun-qwen-ocr/scripts/prepare_ocr_request.py \ --image "https://example.com/table.png" \ --task table_parsing \ --model qwen-vl-ocr-2025-11-20 操作指南 对于标准解析任务,首选内置 OCR 任务,因为它们使用官方任务提示。 对于关键业务字段,在 OCR 之后添加下游验证规则。 qwen-vl-ocr 和旧快照默认最大输出令牌为 4096,除非阿里云批准更高的限制;qwen-vl-ocr-2025-11-20 遵循模型最大值。 仅当小文本被遗漏时才增加最大像素,这会提高令牌成本。 输出位置 默认输出:output/aliyun-qwen-ocr/request.json 使用 OUTPUT_DIR 覆盖基目录。 参考 references/api_reference.md references/sources.md