Data Construction Skill — 数据构建技能
v1.0.0从markdown书籍或长markdown文档中构建概念、过程和案例应用监督数据集。用于从大量...生成训练数据时。
运行时依赖
安装命令
点击复制本土化适配说明
Data Construction Skill — 数据构建技能 安装说明: 安装命令:["openclaw skills install data-construction-skill"] 支持国内镜像加速,使用 --registry https://cn.longxiaskill.com 参数可加速下载
技能文档
Text2QA Builder 从 markdown 书籍或长 markdown 文档中构建监督数据集。书籍仅作为知识来源。最终数据集必须教授可重用的领域知识和如何应用它。不要生成书籍理解问题、引用引导问题或文档结构问题。默认行为是完全覆盖,而不是采样。
数据集目标 将书籍知识编译成三个互补的监督形式: concept_qa:教授原子可重用的知识,例如定义、类别、规则、机制、目的和约束。 process_qa:教授简洁、有根据的推理模式,例如条件检查、规则应用、因果解释、比较、异常处理和步骤排序。 case_application:教授将知识转移到现实但基于源的场景中,模型必须分析情况并应用书籍的知识。使用所有三个形式,当支持时。不要强制每个块都使用三个形式。
输入 使用以下两种输入之一: markdown 文件目录。 一个或多个预计算的 .chunks.jsonl 文件。如果块文件已经存在,则重用它们,而不是重新拆分源书籍。
完成规则 任务仅在每个块都有以下结果之一时才算完成: 至少写入一个监督记录到批处理 JSONL 文件,并写入一个匹配的保留记录到 chunk_status.jsonl。 或在 chunk_status.jsonl 中记录一个跳过决定,带有非空的 skip_reason。
不要在生成小样本后停止,除非用户明确要求生成小样本。不要报告任务完成、完成、结束或准备好,直到以下所有条件都为真: check_coverage.py 报告 unprocessed_chunks = 0 sample_without_status_preview 为空 sample_status_mismatch_preview 为空
输出文件 使用可恢复的工作布局,如下所示: work/ manifest.jsonl chunks/ book_a.chunks.jsonl supervision_batches/ batch_001.jsonl batch_002.jsonl chunk_status.jsonl supervision_merged.jsonl validation.json coverage.json chunk_status.jsonl 是完整运行所必需的。
工作流程
- 准备语料库
- 批处理块文件
- 状态和样本同步规则
分类:决定块是否具有知识价值 保留块,如果它包含可重用的知识,例如: 定义 实体的功能 过程步骤 机制 比较 原因 目的 规则和约束 类别 枚举 条件、异常或后果 运作区别,教授可重用的知识 跳过块,如果它主要是: 致谢 目录 作者列表 导航结构 没有正文的标题 破损的 OCR 片段 页面家具 没有可教命题的索引列表 仅包含教学的文本,例如练习、学习提示或自我检查说明,没有可重用的知识 没有实质命题的纯过渡文本 不教授可重用事实、规则、区别、机制或应用模式的通用填充文本 如果块不包含可教的知识,生成 0 个样本并记录跳过原因。
允许的跳过原因 仅使用以下值作为 skip_reason: navigation non_knowledge pedagogy heading_only