运行时依赖
安装命令
点击复制技能文档
类别:提供者 Model Studio EMO 验证 mkdir -p output/aliyun-emo python -m py_compile skills/ai/video/aliyun-emo/scripts/prepare_emo_request.py && echo "py_compile_ok" > output/aliyun-emo/validate.txt 通过标准:命令退出 0 且 output/aliyun-emo/validate.txt 生成。 输出和证据 在 output/aliyun-emo/ 下保存规范化的请求负载、检测框和任务轮询快照。 记录所选的 style_level 和确切的 face_bbox / ext_bbox。 当输入是肖像图像和语音音频,并且需要非万表达的 talking-head 结果时使用 EMO。 关键模型名称 使用以下确切的模型字符串: emo-v1-detect emo-v1 选择指南 首先运行图像检测以获取 face_bbox 和 ext_bbox。 仅在检测成功后使用 emo-v1。 先决条件 仅限中国大陆(北京)。 在环境中设置 DASHSCOPE_API_KEY,或将 dashscope_api_key 添加到 ~/.alibabacloud/credentials。 输入文件必须是公共 HTTP/HTTPS URL。 规范化接口(video.emo) 检测请求 模型(字符串,选项):默认 emo-v1-detect image_url(字符串,必需) 生成请求 模型(字符串,选项):默认 emo-v1 image_url(字符串,必需) audio_url(字符串,必需) face_bbox(整数数组,必需) ext_bbox(整数数组,必需) style_level(字符串,选项):normal、calm 或 active 响应 task_id(字符串) task_status(字符串) video_url(字符串,当完成时) 快速开始 python skills/ai/video/aliyun-emo/scripts/prepare_emo_request.py \ --image-url "https://example.com/portrait.png" \ --audio-url "https://example.com/speech.mp3" \ --face-bbox 302,286,610,593 \ --ext-bbox 71,9,840,778 \ --style-level active 操作指南 不要发明 face_bbox 或 ext_bbox;使用检测 API 输出。 ext_bbox 比率决定输出格式:1:1 得出 512x512,3:4 得出 512x704。 保持输入肖像清晰和正面以获得更好的表情质量。 EMO 专注于肖像;对于全场景人类视频,请使用其他技能。 输出位置 默认输出:output/aliyun-emo/request.json 使用 OUTPUT_DIR 覆盖基目录。 参考 references/sources.md GitHub CLI API