【免费下载链接】DataArc-SynData-ToolkitSynthetic Data Generation Platform By DataArcTech项目地址https://gitcode.com/gh_mirrors/da/DataArc-SynData-Toolkit点击查看免费下载 用合成数据完成 SFT 或 GRPO 训练后模型到底变好了没有DataArc SynData Toolkit是一款一站式合成数据生成平台除了数据合成与后训练能力外它深度集成了DeepEval评估框架通过 LLM-as-a-JudgeG-Eval机制提供答案正确性、格式合规性、成对偏好三大评估指标一条命令即可完成训练后效果验证。本文带你快速读懂这套「训练后模型评估」方案 图从配置到合成数据、训练模型的完整流水线——评估环节为训练产出模型「把关」一、为什么需要训练后评估合成数据训练的典型链路是文档/语料 → 数据合成 → 数据过滤 → SFT / GRPO 训练 → 产出模型。训练日志里的 loss 下降并不等于模型真的变强你需要一套客观、可复现的验证手段。DataArc SynData Toolkit 将评估能力内置在平台中核心实现位于 sdgsystem/deepeval/ 模块评估编排器sdgsystem/deepeval/evaluator.py指标与配置定义sdgsystem/deepeval/config.py命令行入口sdg evalsdgsystem/cli.py它统一采用G-EvalLLM-as-a-Judge打分方式由一个裁判大模型如 gpt-4o 系列按照可定制的评估标准与评分细则Rubric对模型输出给出 0–10 分并附理由兼顾了灵活性与可解释性。二、三大 DeepEval 评估指标详解1️⃣ Answer Correctness答案正确性对比模型实际输出 vs 标准答案ground truth判断事实层面是否正确。默认 0–10 分四档 Rubric0–2 完全错误、3–5 部分正确、6–8 基本正确、9–10 完全正确默认通过线0.7分数低于阈值记为未通过实现见 sdgsystem/deepeval/metrics/correctness.py 这是最直观回答训练有没有用的指标正确率提升 模型真的更强了。2️⃣ Format Compliance格式合规性训练时你往往要求模型按特定格式输出例如分步推理 在 ##### 后给出最终答案。该指标检查模型输出是否遵循你在配置中指定的 output_instruction 格式要求默认通过线0.8评估步骤自动从输出指令中提取格式要求逐项核对结构与要素实现见 sdgsystem/deepeval/metrics/format_compliance.py 对下游自动化解析抽取答案、结构化落库来说格式合规率与正确率同样关键。3️⃣ Pairwise Preference成对偏好比较没有标准答案没关系。该指标让裁判模型独立先自行判断正确答案再对比两个回答Response A 训练后模型输出Response B 基础模型base model输出离散打分10 A 胜训练后模型赢、5 平局、0 B 胜双方都正确时偏好更清晰、简洁的回答出现幻觉或无关内容会被重罚实现见 sdgsystem/deepeval/metrics/pairwise.py⚖️ 最终汇总会给出post_trained_win_rate胜率直观告诉你训练后模型相对原始模型赢了多少。指标对比对象打分方式默认通过线Answer Correctness模型输出 vs 标准答案G-Eval 0–10 分0.7Format Compliance模型输出 vs 输出指令G-Eval 0–10 分0.8Pairwise Preference训练后模型 vs 基础模型10 胜 / 5 平 / 0 负—三、快速上手一条命令跑完评估1. 准备测试数据准备一份 JSONL 格式测试集每行包含input问题与output参考答案两个字段。项目内置了多领域示例数据可供参考数学examples/mathematics/gsm8k_demo.jsonl金融CFAexamples/finance/cfa_demo.jsonl医学examples/medicine/medqa_demo.jsonl图CFA 教材页面示例——平台支持从此类领域文档合成数据训练后同样可用该领域的题目验证效果2. 配置评估参数基于官方配置样例 configs/eval.yaml 修改即可关键项包括dataset.path测试集路径post_trained_model待评估的已训练模型路径、设备、显存等judge_model裁判大模型名称三大指标的enabled开关以及 criteria / evaluation_steps / rubric 均可自定义⚠️ 开启 Pairwise 指标时必须配置pairwise.base_model用于对比的基础模型否则配置校验会直接报错这是新手最容易踩的坑。3. 配置环境变量并运行在项目根目录的.env文件中配置OPENAI_API_KEY裁判模型走 OpenAI 兼容接口、OPENAI_BASE_URL可选、CONFIDENT_API_KEYConfident AI 密钥注册后可免费创建。然后执行uv run sdg eval configs/eval.yaml支持命令行参数临时覆盖无需改配置--dataset换测试集、--model换待评估模型、--output换结果目录详见 sdgsystem/cli.py。 如果你用 verl 完成了 GRPO 训练checkpoint 需先合并为 HuggingFace 格式再评估python -m verl.model_merger merge --backend fsdp --local_dir checkpoint --target_dir output合并逻辑位于 verl/model_merger/。四、读懂评估报告评估完成后结果默认写入./deepeval_results目录可配置每个启用的指标各生成一个 JSON 报告correctness_results.jsonformat_compliance_results.jsonpairwise_results.json 重点关注summary部分average_score平均得分0–1 归一化pass_rate通过率超过阈值的样本占比post_trained_win_rate / base_model_wins / ties成对比较中的胜率、负率与平局数同时报告还会标注数据集总样本数与被跳过的样本数模型未生成有效输出的样本会自动剔除并告警确保分数不被误读为全集结果。每条明细都保留了输入、期望输出、实际输出、得分与裁判理由方便逐条归因分析。五、使用建议小结✅三指标全开正确性看对不对合规性看规矩不规矩成对比较看是否比原版强交叉验证更可信✅测试集留足量建议在 docs/USE_CASES_zh.md 的对应领域数据上抽取验证集保证领域一致✅固定裁判模型与推理参数默认 temperature0保证多次评估结果可比✅ 自定义 rubric 与评估步骤时保持评分档位描述互斥、可判定能显著提升打分稳定性结语DataArc SynData Toolkit 把合成数据 → 后训练 → 效果验证串成了完整闭环DeepEval 三大评估指标让训练后的效果从感觉变好了变成分数证明了。无论是验证 SFT 的领域知识注入效果还是检验 GRPO 的推理提升一条sdg eval命令即可拿到可复现的量化报告值得每位做模型训练的同学上手试试 赞分享【免费下载链接】DataArc-SynData-ToolkitSynthetic Data Generation Platform By DataArcTech项目地址https://gitcode.com/gh_mirrors/da/DataArc-SynData-Toolkit点击查看免费下载相关推荐一条命令完成模型后训练DataArc SynData Toolkit的SFT与GRPO训练完全指南一条命令完成模型后训练DataArc SynData Toolkit的SFT与GRPO训练完全指南 DataArc SynData Toolkit 是一个开源DataArc SynData Toolkit图像模态教程如何用VLM生成VQA视觉问答训练数据DataArc SynData Toolkit图像模态教程如何用VLM生成VQA视觉问答训练数据 DataArc SynData Toolkit 是由 Dat让手机和电脑共用一个AI助手openclaw多设备协同10分钟上手指南让手机和电脑共用一个AI助手openclaw多设备协同10分钟上手指南 openclaw 是一个跨平台的个人 AI 助手桌面设备跑网关Gateway手AI 应用AI Agent交互助手后端即时通讯网关创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考