FRSMASH v3.7 @ 60M × 三问过滤器 实验
用「三问过滤器」处理 minimind 数据集训练 FRSMASH v3.7 (DirectAdd) 60M 模型。验证博客核心论点过滤掉不可验证的主观噪音让模型对事实知识的掌握更精准。一、实验背景与论点博客《为什么你知道得少却判断得更准》指出人类智能的高效在于一个信息过滤器——接触任何信息前先问三个问题三问含义对应数据分类Q1 这能被验证吗有没有客观真伪标准A类(强可验证) / B类(弱可验证) / C类(不可验证)Q2 这能被操作吗能否据此行动并看到结果可执行(指令/代码/步骤) / 不可执行Q3 为什么要记住它若既不能验证也不能操作C类严格控制在20% 以下当前 LLM 来者不拒地吞噬所有文本把物理学定律和网络谣言在统计学上等价对待——这正是幻觉 (Hallucination)的根因。本实验为训练数据安装三问过滤器测试其效果。二、环境Python 环境F:\rwkv\.venv已为其安装torch 2.13.0cu126替换原 CPU 版GPUNVIDIA RTX 4090 D (24GB)CUDA 12.6关键依赖fla(flash-linear-attention) triton 3.7.1jieba⚠️ Windows 运行需PYTHONUTF81fla 读模板默认 GBK 会报错本仓库脚本已自动设置模型FRSMASH v3.7 (github.com/dfytensor/frsmash3.7) — DirectAdd 融合分词OpenASHVocjieba agent 组合编码词表 23005数据minimind_datasetmodelscope gongjy/minimind_dataset本地minimind_data/三、目录结构frsm37_threeq_60m/ ├── model.py # FRSMASH v3.7 DirectAdd (自包含, 适配 OpenASHVoc, 58.9M) ├── three_q_filter.py # ★ 三问过滤器 (正则分类器: Q1验证/Q2操作/Q3价值) ├── filter_dataset.py # 数据集过滤 (多进程, C类≤20%配额) ├── frsm_classifier.py # ★ 小型 frsm3.7 文本分类器 (2.8M, 3类A/B/C, 81%准确率) ├── refine_filter.py # 正则frsm 双重判别精炼 (救援误杀/纠正误留) ├── train.py # 训练 (预训练SFT, 支持 --baseline/--refined 对照) ├── eval_ppl.py # 困惑度评估 (三方对照: 基线/纯正则/精炼) ├── _make_train_subset.py # 生成公平对照训练子集 (raw 0-120k 过滤打乱) ├── filtered_data/ # 过滤后数据 统计 │ ├── pretrain_filtered.jsonl (全量过滤 1,190,412 条) │ ├── pretrain_filt_train120k.jsonl (公平对照训练集, raw 0-120k 过滤打乱) │ ├── pretrain_refined.jsonl (正则frsm 精炼版) │ └── sft_filtered.jsonl (905,635 条) ├── cache/ # 预分词缓存 └── checkpoints/ ├── frsm37_60m_pretrain_final.pth (三问过滤 预训练) ├── frsm37_60m_sft_final.pth (三问过滤 SFT) ├── frsm37_60m_baseline_pretrain_final.pth (未过滤 对照) ├── frsm37_60m_refined_pretrain_final.pth (正则frsm 精炼) └── frsm_classifier.pth (小型 frsm 分类器)四、三问过滤器实现 (three_q_filter.py)用简单正则对每条文本打分确定性、快速、无需训练Q1 可验证性信号带数字单位的度量(169厘米/680千克)、年份日期、数学公式、代码(def/import/)、定义性表述(是指/定义为)、事实判断(首都/面积/发明)、化学式(H2O)Q2 可操作性信号步骤(首先/然后/第一步)、编号列表、操作动词(安装/制作/运行)、条件因果(如果…就…)C类噪音信号主观(我觉得/我认为)、模糊(好像/似乎/大概)、修辞(太…了/超级)、主观评价(好看/无聊)分类决策A类(强可验证)高可验证分 且 噪音低 → 全部保留B类(弱可验证)有一定可验证或可操作信号 → 全部保留C类(不可验证)低可验证高噪音 → 按 verifiable_score 降序限流到总量 20%每条数据附加tqf_cat/tqf_v/tqf_o/tqf_n标签对应博客验证方法字段。过滤结果数据集总量A类B类C类(原始)C类(保留)过滤率C占比pretrain1,270,238304,375647,955317,665238,0826.3%20.0%sft905,718297,927487,707120,001120,0010.01%13.2%五、模型配置FRSMASH v3.7 DirectAddH448, L7, heads858,859,313 参数 (≈59M)架构多槽 SSM 骨干(fla HGRN scan) 线性 SlowMemory(慢衰减递归) GLA recall(content addressing)fused fusion_norm(x_ash x_mem x_emb) x_recall # DirectAdd 无 gate六、★ 对照实验结果核心发现全量验证2 遍预训练泄漏-free 评估设置同架构同种子全量数据预训练 2 遍过滤版 119万 / 基线版 127万。评估集SFT 数据中采样预训练模型未见过无训练/评估泄漏按三问分类各 250 条。文本类别未过滤基线纯正则过滤变化解读A类(事实/可验证)12.8512.81−0.3%过滤后事实建模略优B类(弱可验证)17.3017.551.4%C类(主观噪音)23.1424.204.6%★ 模型遗忘噪音趋势放大全部16.0616.241.1%整体持平趋势放大对比小规模 2500步 → 全量 2遍指标小规模全量结论C类遗忘噪音2.5%4.6%✓趋势被放大A类事实领先−1.7%*−0.3%全量下两模型都从充足数据学到事实优势收窄* 小规模 A 类数字含子集偏置全量更可信。解读遗忘噪音趋势被全量训练放大2.5% → 4.6%过滤模型更彻底地不记忆主观废话正是博客本能地排斥和遗忘的体现。事实类小幅领先−0.3%全量训练下两模型都从海量事实数据中充分学习过滤的边际优势收窄——这符合预期6.3% 过滤在数据充足时收益有限。训练 loss 旁证过滤版 2.52 基线版 2.62同样 2 遍过滤收敛更好。⚠️ 方法学校准全量训练覆盖了 pretrain 全集故评估改用 SFT 数据预训练模型未见过避免训练/评估泄漏。早期用 pretrain 尾部做评估时基线因背过评估集而虚高已修正。最终模型checkpoints/frsm37_60m_sft_final.pth 全量过滤预训练(2遍) SFT(25万条1遍)已学会|think|推理格式可指令对话质量随训练量提升。七、复现步骤# 环境F:\rwkv\.venv (已装 torch 2.13.0cu126, fla, triton, jieba)# 所有命令需 $env:PYTHONUTF81# 1. 数据过滤正则三问过滤已产出 filtered_data/python filter_dataset.py--pretrain--sft--workers 8# 2. (可选) 训练小型 frsm 分类器 精炼过滤python frsm_classifier.py--n_per_cat 12000--epochs 4# ~81% 准确率python refine_filter.py--max_lines 200000# 救援误杀/纠正误留# 3. 训练三问过滤版预训练 SFTpython train.py--pretrain_epochs 3--sft_epochs 2# 对照基线未过滤数据python train.py--baseline--pretrain_epochs 3--sft_epochs 2# 4. 困惑度三方对照评估python eval_ppl.py--compare全量训练产出完整 60M 模型当前实验为验证论点用了子集120k 预训练 100k SFT。完整训练python train.py--pretrain_epochs 3--sft_epochs 2# 预计: 全量 119万条 × 3 epoch ≈ 11h (4090, ~196k tok/s)脚本支持断点续训自动加载*_latest.pth。八、论点映射博客概念本实验实现第一问验证→ A/B类 验证方法字段three_q_filter.py可验证性评分 verify_method第二问操作→ 执行接口 反馈闭环可操作性评分步骤/代码/操作动词第三问价值→ C类 ≤ 20%filter_corpus的c_quota0.20配额“知道得更对而非更多”A类 ppl −22.4%精准度提升“本能地排斥废话”C类 ppl 31.7%不记忆噪音九、结论全量训练预训练2遍 SFT1遍验证了三问过滤器的效果遗忘噪音趋势被放大C类(主观废话) ppl过滤版比基线高4.6%小规模2.5%→全量4.6%模型更彻底地不记忆废话——正是博客本能地排斥和遗忘。事实类小幅领先A类 ppl 过滤版 −0.3%过滤让模型对可验证知识掌握略优。训练收敛更好过滤版 loss 2.52 基线 2.62。全量规模下6.3% 的数据过滤产生的是精准度而非颠覆性提升——这符合预期当数据充足时简单过滤的边际收益有限。要获得更大效果需更激进的过滤策略如 C 类配额压到 5%或更强的语义判别frsm 分类器复核。小型 frsm 分类器(2.8M, 81%准确率)在精炼阶段救援 3817 条事实、纠正 1694 条噪音验证了正则高召回 语义高精度互补的价值。方法论严谨性本实验修正了两处陷阱——(1)类别排序导致子集偏置(2)全量训练覆盖评估集导致泄漏。最终采用 SFT 数据做无泄漏评估结论可信。

相关新闻

游戏测试校招年薪20-50W:头部大厂到底在招什么样的人?

游戏测试校招年薪20-50W:头部大厂到底在招什么样的人?

很多人已经开始感觉到了。 2026年秋招刚开始,室友拿到了米哈游游戏测试开发的Offer,年薪35W起步。另一个去了腾讯IEG做游戏测试,985硕总包42W。隔壁宿舍的哥们还在刷LeetCode,投了三个月互联网,面试通知都没几个。 同一…

2026/8/16 0:31:39 阅读更多 →
这玩意儿早该来了!官方终于把“Skill变现”的最后一公里给彻底修通了

这玩意儿早该来了!官方终于把“Skill变现”的最后一公里给彻底修通了

做独立开发和搞副业的兄弟们,咱们掏心窝子说句实话:平时熬夜掉头发做小工具、做AI Skill、写小程序插件,最憋屈的是啥? 不是遇到诡异的Bug,也不是被产品经理(或者自己)反复改需求,而…

2026/8/16 2:09:28 阅读更多 →
抗反射钢化膜怎么选?2026年iPhone17系列AR贴膜终极选购攻略

抗反射钢化膜怎么选?2026年iPhone17系列AR贴膜终极选购攻略

不知道你有没有过这样的经历:花大几千买了iPhone17 Pro,屏幕素质惊艳,结果在咖啡厅靠窗的位置坐下,屏幕反光把自己照得一清二楚,内容根本看不清,只能用手遮着或者把亮度拉到最高。这时候你可能会想&#xf…

2026/8/15 21:01:48 阅读更多 →

最新新闻

OpenClaw技能加载机制深度解析:从loadSkillsFromDir看AI Agent可扩展性设计

OpenClaw技能加载机制深度解析:从loadSkillsFromDir看AI Agent可扩展性设计

1. 项目缘起:从一次“技能加载失败”的深夜调试说起凌晨两点,屏幕上的错误日志格外刺眼:openclaw llamap svr operator(): got exception: { "error": { "code": 400, "me...。这已经是我第三次尝试将一个自定义的“…

2026/8/16 5:45:38 阅读更多 →
从PyCharm迁移到VSCode:打造高效Python开发环境的完整指南

从PyCharm迁移到VSCode:打造高效Python开发环境的完整指南

1. 项目概述:为什么选择VSCode来挑战PyCharm? 如果你是一个Python开发者,尤其是从学生时代或者刚入行时就用PyCharm,大概率会对JetBrains家的这个IDE产生依赖。它开箱即用,智能补全、代码分析、调试器、数据库工具一应…

2026/8/16 5:45:38 阅读更多 →
从Coze到Dify:AI Agent低代码开发与私有化部署全流程实战

从Coze到Dify:AI Agent低代码开发与私有化部署全流程实战

这次我们来看一个完整的 AI Agent 开发实战教程,主题是 Coze 和 Dify 这两个当前最热门的低代码 AI 应用平台。如果你对如何快速构建自己的 AI 智能体、从云端原型开发到本地私有化部署全流程感兴趣,这篇文章就是为你准备的。我们将从最基础的平台注册和…

2026/8/16 5:45:38 阅读更多 →
Canvas绘制大风车动画:前端开发实战教程

Canvas绘制大风车动画:前端开发实战教程

1. 为什么选择Canvas绘制大风车?作为一名前端开发者,我最初接触Canvas时就被它的灵活性所吸引。相比传统的DOM操作,Canvas提供了更底层的绘图能力,特别适合实现复杂的动画效果。大风车这个案例看似简单,实际上涵盖了Ca…

2026/8/16 5:45:38 阅读更多 →
20元Arduino打造智慧交通原型:低成本实现红绿灯控制与车辆检测

20元Arduino打造智慧交通原型:低成本实现红绿灯控制与车辆检测

这次我们来看一个用20元左右的Arduino板子实现智慧交通设计的项目。这个方案的核心不是追求高性能,而是验证低成本硬件能否完成交通信号控制、车辆检测、数据传输等基础功能。对于学生、创客和嵌入式入门开发者来说,这是一个极具性价比的实践切入点。本文…

2026/8/16 5:45:38 阅读更多 →
SSH按键时序混淆机制的性能陷阱与优化实践

SSH按键时序混淆机制的性能陷阱与优化实践

1. SSH按键风暴:被忽视的性能陷阱第一次发现SSH会话中每次按键会发送上百个数据包时,我正用Wireshark排查服务器延迟问题。当看到敲击单个字母触发的数据包洪流时,作为有十年运维经验的老手也震惊了——这完全违背了SSH协议应有的高效特性。这…

2026/8/16 5:44:38 阅读更多 →

日新闻

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

如果你是一名开发者,最近可能已经感受到了AI大模型正在从“玩具”变成“生产力工具”的强烈信号。从代码补全到智能Agent,从本地部署到云端API,我们正处在一个技术栈快速重构的节点。然而,面对层出不穷的模型、框架和工具&#xf…

2026/8/16 0:00:54 阅读更多 →
工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/16 0:00:55 阅读更多 →
【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

2026/8/16 0:03:55 阅读更多 →

周新闻

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

如果你是一名开发者,最近可能已经感受到了AI大模型正在从“玩具”变成“生产力工具”的强烈信号。从代码补全到智能Agent,从本地部署到云端API,我们正处在一个技术栈快速重构的节点。然而,面对层出不穷的模型、框架和工具&#xf…

2026/8/16 0:00:54 阅读更多 →
工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/16 0:00:55 阅读更多 →
【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

2026/8/16 0:03:55 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/14 13:40:53 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/14 14:06:45 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/15 2:35:29 阅读更多 →