【免费下载链接】DataArc-SynData-ToolkitSynthetic Data Generation Platform By DataArcTech项目地址https://gitcode.com/gh_mirrors/da/DataArc-SynData-Toolkit点击查看免费下载DataArc SynData Toolkit是一款开源合成数据生成平台而 configs/sdg.yaml 是驱动整条数据合成流水线的唯一配置文件——改好它一条命令就能批量产出可训练的大模型数据。本文逐行带你读懂 sdg.yaml 的每个字段从全局参数、任务定义、数据源选择到投票质检、自动评估与难度改写10 分钟完成你的第一份数据合成配置。️ 先看全景sdg.yaml 如何驱动数据合成流水线在逐字段讲解前先建立整体认知用户只需提供一份 .yaml 配置文件系统就会按数据生成 → 初筛 → 过滤与改写 → 训练数据的顺序自动执行。sdg.yaml 的每一个章节都对应下图中的一个环节对应关系一目了然sdg.yaml 章节流水线环节作用全局配置device 等整体运行环境指定 GPU、并发、输出目录task选择数据源路由local / web / distill 三选一llm/base_model生成与评估双模型分工一个出题一个判卷postprocessData Filtering多数投票质检evaluationrewriteData Filtering Rewriting打分、按难度改写translation低资源语言支持翻译为阿拉伯语等所有字段的 Pydantic 定义可在 sdgsystem/configs/config.py 中找到默认值集中在 sdgsystem/configs/constants.py。⚙️ 一、全局配置GPU、并发与输出格式文件开头的 4 个顶层字段决定整条流水线的运行环境device: cuda:0 # 所有 GPU 操作使用的显卡 n_workers: 1 # 并行 worker 数1 可加速 output_dir: ./outputs/gsm8k # 合成数据集输出目录 export_format: jsonl # 数据集导出格式devicevLLM 推理、语义相似度模型、MinerU 文档解析共用这一块 GPU。多卡机器可改成cuda:1。n_workers默认 1 为顺序处理文档量大时调成 2~4 可显著提速官方 examples/mathematics/math.yaml 中就用n_workers: 2。output_direxport_format最终数据集保存位置与格式推荐保持jsonl。 二、task任务定义核心中的核心task是整个配置里最关键的章节它回答三个问题生成什么怎么生成生成多少2.1 基本信息name / domain / demo_examples_pathtask: name: gsm8k # 任务名也是输出文件名的前缀 domain: mathematics # 目标领域关键词逗号/空格分隔多个 demo_examples_path: /path/to/demo_examples.jsonl # 示例文件可选domain领域关键词会直接追加进检索关键词帮助 BM25 从文档库里找到对的方向。例如金融任务可写finance, CFA, asset valuation。demo_examples_path指向一个 jsonl 示例文件仓库已提供 examples/finance/cfa_demo.jsonl 等示例越多生成风格越接近你的目标格式。2.2 三条指令task / input / output这是教 LLM 出题的地方三段文本会被拼接进生成提示词task_instruction: - Generate a grade school math word problem that requires multi-step reasoning. input_instruction: - The input should be a math word problem that requires multi-step reasoning. output_instruction: - The output should contain reasoning process step by step.task_instruction定义数据集的类型、结构和要求是整个合成的总纲。input_instruction/output_instruction分别约束生成数据input题目和output解答的格式。它们还会被自动注入到评估与改写环节见 sdgsystem/configs/config.py保证全流水线格式一致。2.3 生成规模num_samples 与 batch_sizenum_samples: 10 # 最终想合成多少条样本 batch_size: 5 # 流水线中每批处理的条数num_samples是订单量batch_size是每车装多少——两者独立调大 batch 可提高吞吐。2.4 选择数据源text 模态三选一task.text下local / web / distill 只能选一个同时配置多个会直接报错见 sdgsystem/tasks/task_executor.py方案 Atext.local —— 从本地文档合成最常用text: local: parsing: document_dir: /path/to/your/document_dir # PDF 文档目录 method: mineru # 解析器默认 MinerU retrieval: passages_dir: ./dataset/passages # 切块后的段落存放目录 method: bm25 # 检索器默认 BM25 top_k: 1000 # 检索 Top-K 段落 generation: temperature: 1.0 # 生成温度流程是MinerU 解析 PDF → 递归切块512 字符、50 重叠→ 用任务指令抽取领域关键词 → BM25 检索 Top-K 段落 → LLM 基于段落生成题目。三个子配置各司其职parsingdocument_dir指向你的教材/题库 PDF 目录method默认mineru数学教材效果尤佳如下面的《Master Math》样例。retrievalpassages_dir是中间产物目录可断点续跑top_k越大合成内容越多样但越慢。generationtemperature建议 1.0生成多样性更好。方案 Btext.web —— 从 HuggingFace 爬取text: web: huggingface_token: hf_ # 可选也可用环境变量 HUGGINGFACE_TOKEN dataset_limit: 5 # 每个关键词爬取的数据集数量适合没有本地语料时自动从 HuggingFace 检索相关数据集并合成实现见 sdgsystem/huggingface/crawl.py。方案 Ctext.distill —— 纯大模型蒸馏text: distill: temperature: 1.0完全不依赖文档直接由教师模型按指令无中生有式蒸馏实现见 sdgsystem/distillation/sdg_distill.py。图像模态image与 text 二选一如需生成 VQA视觉问答数据把text注释掉改用imagelocal支持image_dir图片目录和 PDF 抽图parsingweb则从 HuggingFace 检索图文数据集。输出格式会多出image: path/to/image.png字段且llm需换成 VLM如 gpt-4o、base_model换成视觉模型如 Qwen3-VL。 三、双模型配置llm 与 base_model流水线里有两个角色分工清晰的模型base_model: path: Qwen/Qwen2.5-7B # 本地模型vLLM 部署负责判卷评估 llm: provider: openai # API 提供方openai / ollama model: gpt-4o-mini # 云端模型负责出题生成、投票、改写llm整条流水线的主力——数据生成、多数投票、难度改写都走它。API Key 和 Base URL 写在项目根目录的.env文件中而不是 yaml 里。base_model本地部署vLLM只在评估阶段用它做题、给样本难度打分不依赖外部 API免费且稳定。本地模型还支持max_model_len、gpu_memory_utilization等可选字段。️ 四、answer_extraction答案标记规则answer_extraction: tag: #### instruction: Output your final answer after ####这两个字段告诉 LLM如何标注最终答案解答末尾的####之后即标准答案后续投票、评估都靠它抽取答案。GSM8K 数据集用的正是####约定见 docs/USE_CASES.md。如果你的目标数据集用answer等标记直接改这里即可。✅ 五、postprocess多数投票质量门生成完的数据先过一道投票质检对每条样本让 LLM 答n次取多数一致的答案过滤不稳定样本。postprocess: methods: - majority_voting # 默认且目前唯一支持的后处理方法 majority_voting: n: 8 # 投票次数越多越稳、token 越多 exact_match: # 三选一exact_match / semantic_clustering / llm_judge numeric_tolerance: 1e-3三种判定策略按成本递增、效果递增排列三选一只保留一个exact_match字符串精确匹配numeric_tolerance给数字答案留容差设 0 则严格匹配适合数学题。semantic_clustering用语义模型默认BAAI/bge-m3聚类相似答案similarity_threshold: 0.85为判定阈值对表述差异更宽容。llm_judge让 LLM 当裁判效果最好但最贵temperature: 0.3。 六、evaluation自动评估与三档分流这是本工具包的亮点base_model 会给每条样本打分最后把数据集分成三份——太简单solved/ 难度合适learnable/ 太难unsolved方便按难度取用逻辑见 sdgsystem/pipeline.py。evaluation: inference: # 第一轮二元评估会做/不会做 temperature: 0.0 max_tokens: 1500 n: 1 scoring: # 第二轮passn 打分决定难度档位 temperature: 1.2 n: 8 answer_comparison: # 答案比对方式三选一 semantic: model_path: BAAI/bge-m3 similarity_threshold: 0.85inference低温、单样本先快速筛掉 base_model 完全不会的题。scoring高温采样n次算 passn分数在 0~1 之间才属于可学习区间。answer_comparison三选一exact_match/semantic/llm_judge与第五节选项对应建议与投票策略保持一致。 七、rewrite 与 translation改写和多语言rewrite: difficulty_adjust: # 唯一方法按难度调温度改写 easier_temperature: 0.9 # 偏简单样本的改写温度 harder_temperature: 1.1 # 偏难样本的改写温度 translation: language: english # english 表示不翻译arabic 等则触发翻译 # model_path: hammh0a/Hala-1.2B-EN-AR-Translator # 非英语必须指定 max_tokens: 256rewrite评估后对样本做难度调整改写让数据难度更贴合目标模型实现见 sdgsystem/generation/rewriter.py。translationlanguage: english时跳过翻译改为arabic等低资源语言并指定model_path后三份数据集会被整体本地化这是官方支持的多语言合成能力。 八、跑起来一条命令 四个输出文件配置完成后确保.env中已写入API_KEY与可选BASE_URL然后uv run sdg generate configs/sdg.yaml流水线跑完后output_dir下按任务名生成四个 jsonl 文件对应评估的三档分流{name}_solved.jsonl—— base_model 全对偏简单{name}_learnable.jsonl—— 部分答对最推荐用于 SFT/RL 训练{name}_unsolved.jsonl—— 全部答错偏难{name}_final.jsonl—— 合并后的最终数据集中间结果还会缓存在buffer/目录中断后可从上次成功阶段续跑官方称之为token 节省器。更多领域实战示例数学 / 金融 / 医学见 docs/USE_CASES.md现成配置可直接参考 examples/mathematics/math.yaml 与 examples/finance/finance.yaml。 九、新手速查清单先定任务task_instruction写清楚要生成什么domain给准领域词。再选数据源有本地 PDF 用text.local没有就text.web或text.distill。双模型分工llm管生成APIbase_model管评估本地 vLLM。质检三选一预算紧选exact_match追求质量选llm_judge。看输出训练优先用_learnable文件。提速n_workers调大、num_samples分批试跑确认风格后再放量。按这份清单配置你就能用一份 sdg.yaml 驱动整条数据合成流水线——从配置到训练数据中间所有脏活都由工具自动完成。赞分享【免费下载链接】DataArc-SynData-ToolkitSynthetic Data Generation Platform By DataArcTech项目地址https://gitcode.com/gh_mirrors/da/DataArc-SynData-Toolkit点击查看免费下载相关推荐大模型合成数据终极指南一文读懂一站式数据生成平台DataArc SynData Toolkit大模型合成数据终极指南一文读懂一站式数据生成平台DataArc SynData Toolkit DataArc SynData Toolkit 是由 Data从零到第一个数据集DataArc SynData Toolkit 5分钟安装上手完整教程从零到第一个数据集DataArc SynData Toolkit 5分钟安装上手完整教程 DataArc SynData Toolkit 是一款开箱即用的 合WSABuilds 部署 Windows 安卓环境完整指南Win10/Win11 装出带 Play 商店与 Root 的 WSAWSABuilds 部署 Windows 安卓环境完整指南Win10/Win11 装出带 Play 商店与 Root 的 WSA 用 WSABuilds htCLI开发工具云原生创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考