把“人味“变成分数:Human-Likeness 盲测第一的含金量到底几成
把人味变成分数Human-Likeness 盲测第一的含金量到底几成【免费下载链接】Hemmingway-1项目地址: https://ai.gitcode.com/hf_mirrors/Altworld/Hemmingway-1让大模型写一封给房东的短信、一条给同事的告别留言是当下 AI 写作最日常也最被高估的场景多数模型会先给你三个选项、一段开场白、再附一段以上选项说明。Altworld 发布的 Hemmingway-127B 参数基于 Qwen3.8-27B 微调262,144 token 上下文声称自己解决的就是这个问题——你要的是正文不是备忘录。它在自己构建的 Human-Likeness 与 CommunicationBench 两轮盲测中双双登顶前者像真人写的领先第二名 26 分后者综合实用分领先 GPT-6 Astra 50 分。人味这种抽象评价如何被量化成一个分数自建基准的第一名又有几分可信本文拆解这两个基准的构造逻辑结合仓库中的 README.md、config.json 与 chat_template.jinja 源码逐层检验类人与好用这两套评价体系的偏差并追问盲测第一是否等于日常写作体验第一。一、像人写的是怎么被量化的Human-Likeness 的测量逻辑在 README.md 中写得很直白从真实请求中取出 80 条写给房东的、拖了很久没写的难开口留言把 Hemmingway-1 的答案与另一个模型的答案配对顺序打乱后交给裁判裁判不知道哪份出自谁。判定标准只有一个问题这两份里哪一份是真人写的。这套设计有几点值得肯定双盲配对裁判面对的是 A/B 对而非逐个打分避免了绝对评分里的锚定效应——模型生成的文本在绝对量级上都很机器只有相对比较才能暴露差异双向顺序run in both orders同一对组合按两种先后顺序各跑一遍排除先看的那份更占优的位置偏差独立裁判README 明确the judge was a different model from the ones being judged防止模型自我偏好污染评分。结果是 Hemmingway-1 以 26 分的领先优势成为最像人写的那个。注意这里的基准定义它测的不是好不好而是文本指纹层面的拟真度——句式冗余度、口头语气、结构是否像普通人在手机里随手打出来的。一个像人的答案未必是最优解但一定是最低感知成本的那个。二、CommunicationBench不仅要像还要好用如果说 Human-Likeness 问的是谁像人CommunicationBench 问的则是谁的答案更好。同一批 80 条请求、同样的双盲配对与双向顺序只是裁判的判定标准从哪份是人写的换成哪份答得更好。结果同样登顶击败 Fable 5.1领先 GPT-6 Astra 五十分Kimi K3、GLM-5.3、Grok 4.6、DeepSeek V4 Pro 全部排在其后——这是一份 27B 参数模型交出的成绩单。按场景细分README 的分类热力图它的优势集中在金钱与行政、职场沟通、难开口的请求、说服对方回心转意这几类高摩擦场景其中难开口请求hard asks的拟真率高达 72%而 GPT-6 Astra 只有 9%。更有信息量的是 README.md 里单独列出的正文是否被埋没统计Fable 5、GLM-5.3 和 Kimi K3 在超过九成的回复里把真正要写的正文埋在开场白、选项列表和解释性注释之后。这张图揭示了一个关键事实CommunicationBench 的高分很大一部分来自**直给正文**——README 的原话是Hemmingway-1 just gives you the text。不铺垫、不列选项、不解释自己在干什么这是它既像人又好用的共同来源。三、类人与好用之间的统计偏差两个基准第一看似互相印证但必须指出像人与好用是两个不同的统计维度正相关不等于因果。类人得分高的部分原因是低信息冗余。真人短信的特点就是省事没有开场白、没有自我解释、直接给出诉求。模型只要学会克制在这两项基准上都会显著加分。这意味着部分分数反映的是修辞节俭度而非真正的理解人情世故。反向证据来自它输掉的场景。README 坦承它在敌对叙事hostile storytelling和长故事轮次long story turns上输给专门的叙事模型——故事模型的输出在这些场景里更好用却不像日常人话。同一个模型的类人分在叙事场景明显回落说明类人度是一个场景相关的局部属性而不是通用能力。情商与类人并不等价。仓库引用的第三方基准 EQ-Bench 4emotional-intelligence benchmark由独立 harness 运行中Hemmingway-1 排名第三超过 GPT-5.5、Opus 4.7 与 Opus 4.8但与榜首仍差 12 分以内——它像人却在纯粹的情商竞技上不是第一。把这三个证据放一起结论是类人分数衡量的是一种社会语言学层面的拟真与解决沟通摩擦高度相关但不等同于所有维度都更好。它在窄场景日常消息、邮件、短文本沟通里几乎等价于好用一旦离开这个场景相关性就会断裂。四、源码侧凭什么读起来轻高分背后有没有工程支撑仓库 config.json 给出了答案。模型是 64 层的 Qwen3_5ForCausalLMarchitectures: [Qwen3_5ForCausalLM]采用 3:1 混合注意力结构layer_types中每 4 层里有 3 层linear_attention、1 层full_attentionfull_attention_interval: 4线性注意力层还带卷积核linear_conv_kernel_dim: 4。这种线性为主、全注意力为辅的架构正是支撑max_position_embeddings: 262144262K 上下文的物理基础——全注意力在这种长度下 KV 缓存会爆炸线性注意力则让长上下文变得廉价。model.safetensors.index.json 的元数据同时揭示了两个细节total_parameters: 26895998464约 26.9B27B的说法属实且权重表中单独挂载了mtp.*模块model-mtp.safetensors对应mtp_num_hidden_layers: 1即多 token 预测MTP推测解码层——这是为低延迟、轻量场景服务的部署优化。生成配置 generation_config.json 也透露了人味的来源temperature: 1.0、top_k: 20、top_p: 0.95、do_sample: true保守采样配合有限的 top-k 截断在稳定性与自然度之间取平衡——既不会像贪心解码那样呆板重复也不至于发散成不知所云的段落。对话层由 chat_template.jinja 控制三档思考强度reasoning_effort支持xhigh/medium/low历史思考块可裁剪preserve_thinking工具调用采用 XML 风格的tool_call格式并支持多步工具调用链。这些设计共同指向一个目标把推理过程压缩、把输出正文前置——与直给正文的基准设定一脉相承。值得一提的是社区情报中的一处信息出入多篇中文社区文章将 Hemmingway-1 的许可描述为 Apache-2.0但仓库 LICENSE 与 README.md 明确写的是CC BY-NC 4.0非商用免费商用需单独协议。此类事实应以仓库为准这也是评估任何模型时建议回查原始仓库的原因。五、含金量追问第一名的三个前提回到最初的问题。Human-Likeness 第一名的含金量取决于三个前提是否成立前提一基准是自建的。README 在 The fine print 一节主动披露CommunicationBench、Human-Likeness、StoryBench 都是 Altworld 自己构建、自己运行、自己评分的只有 EQ-Bench 4 是第三方。自建基准的优势是能精确度量想优化的场景风险是指标对齐——训练目标与提示策略可能逐步拟合基准偏好形成刷分。双盲、双向、独立裁判的方法论设计部分对冲了这种风险但无法完全消除基准是我定的这一根本张力。前提二样本与语言有边界。80 条真实请求是可信的质性样本但统计上不构成大样本且模型 English-firsttokenizer_config.json 与模板均以英文交互为主。中文日常沟通的人味表现不在这次跑分的覆盖范围内。前提三裁判是模型不是人。更像人写的这一判定由另一模型做出。模型对拟真度的感知与真人评分者高度相关但并非完全一致——真人会更在意上下文契合度与语气细微偏差模型裁判更易受表层句式特征影响。综合来看这次第一名的合理解读是它证明 Hemmingway-1 在日常消息写作这一窄场景下产出最接近真人自然表达、且摩擦成本最低——这个结论在方法设计上站得住在场景界定上诚实在工程上轻量混合注意力、直给正文的训练目标有据可查。它不证明该模型在所有写作场景全面领先——叙事场景的落败、EQ-Bench 第三、80 条英文样本与自建基准的性质都是它在含金量上的扣分项。对普通使用者而言最可靠的验证方式不是看分数而是拿自己真实要发的消息去试把模型输出复制进对话框看看敢不敢直接点发送。当点击发送这件事不再需要删掉一段开场白、三个选项和一个道歉式结尾时那个抽象的人味分数才算真正落了地。【免费下载链接】Hemmingway-1项目地址: https://ai.gitcode.com/hf_mirrors/Altworld/Hemmingway-1创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

C#零配置网络:链路本地地址与mDNS服务发现实战

C#零配置网络:链路本地地址与mDNS服务发现实战

简介:ZeroConfiOS是一个面向C#开发者、聚焦网络服务自动化部署的开源工具库,专为解决动态网络环境下服务发布与IP地址自适应配置难题而设计,适用于物联网设备、跨平台微服务及多网卡场景下的快速集成。资源包共43个文件,含32个核心…

2026/10/11 10:58:28 阅读更多 →
三国人物关系知识图谱可视化与问答系统:构建与工程实现

三国人物关系知识图谱可视化与问答系统:构建与工程实现

简介:基于知识图谱的三国人物关系可视化与问答系统,是一份面向计算机相关专业学生、教师及初学者的完整Python工程项目。项目将三国演义文本数据抽取为实体与关系,构建知识图谱,并配套网页端可视化界面与自然语言问答模块&#xf…

2026/10/11 10:58:28 阅读更多 →
识别虚假技术资源:Bishop深度学习2024真伪验证指南

识别虚假技术资源:Bishop深度学习2024真伪验证指南

简介:这是一本由机器学习权威Christopher M. Bishop与Hugh Bishop合著的深度学习前沿教材,面向高校研究生、AI研究人员及具备数学与编程基础的进阶学习者,系统构建从神经网络基础到Transformer、图神经网络等现代架构的理论框架。资源为单文件…

2026/10/11 10:57:28 阅读更多 →

最新新闻

番茄目标检测数据集验证与质量诊断指南

番茄目标检测数据集验证与质量诊断指南

简介:番茄目标检测数据集专为农业AI开发者与科研人员设计,聚焦真实田间场景下的番茄果实识别任务,有效支撑采摘机器人视觉定位、温室智能监测及植物表型分析等应用。资源采用YOLO标准格式,含626张训练图、179张验证图与90张测试图…

2026/10/11 11:48:16 阅读更多 →
APP同样的日活,双十一他广告收益比你多赚一倍,凭啥?

APP同样的日活,双十一他广告收益比你多赚一倍,凭啥?

每年 10 月中旬开始,做 APP 变现的人其实分两拨。一拨是:双十一快到了,赶紧发版、加弹窗、把开屏插屏全打开,觉得“广告主预算多,闭眼都能多赚”。另一拨不声不响,在干四件“不性感但真给钱”的事。一、先把…

2026/10/11 11:48:16 阅读更多 →
用AI治拖延:从任务拆解到启动执行的实操指南

用AI治拖延:从任务拆解到启动执行的实操指南

看到一篇海外博客分享“AI是如何解决我的拖延症的”,我第一反应是:又来一个标题党。拖延症要是一个对话框能治好,市面上那些时间管理App早就死光了。但读完之后我又觉得,作者描述的那种状态跟我太像了——工具装了一堆&#xff0c…

2026/10/11 11:48:16 阅读更多 →
设备指纹与指纹浏览器:多账号防关联的底层原理与实战

设备指纹与指纹浏览器:多账号防关联的底层原理与实战

一台电脑上打开十个浏览器窗口,分别登录十个不同的电商店铺账号,平台会不会把这十个账号当成同一个人?我的经验是:大概率会。别说是十个窗口,哪怕你只是在一个浏览器里反复切换登录,平台也能通过设备指纹把…

2026/10/11 11:48:16 阅读更多 →
VS Code连不上服务器?Remote-SSH高频故障排查指南

VS Code连不上服务器?Remote-SSH高频故障排查指南

做远程开发的同学,十有八九都遇到过这个画面:本地VS Code右下角弹出一个提示框,状态栏开始转圈,几秒钟后蹦出一行红字“无法连接到远程服务器”。更气人的是,有些人上一秒还连得好好的,只是电脑休眠了一下&…

2026/10/11 11:48:16 阅读更多 →
Sentinel-LDK-Run-time-setup8.15:运行时环境搭建与避坑指南

Sentinel-LDK-Run-time-setup8.15:运行时环境搭建与避坑指南

简介:Sentinel-LDK-Run-time-setup8.15 是一份面向软件授权与加密保护开发者的运行时环境安装资源,主要服务于需要部署 Sentinel LDK 加密狗运行环境的工程师与技术支持人员,帮助解决授权组件在目标机器上无法正常识别或加载的问题。压缩包共…

2026/10/11 11:47:15 阅读更多 →

日新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 10:45:37 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/9 21:32:20 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 10:38:42 阅读更多 →