把人味变成分数Human-Likeness 盲测第一的含金量到底几成【免费下载链接】Hemmingway-1项目地址: https://ai.gitcode.com/hf_mirrors/Altworld/Hemmingway-1让大模型写一封给房东的短信、一条给同事的告别留言是当下 AI 写作最日常也最被高估的场景多数模型会先给你三个选项、一段开场白、再附一段以上选项说明。Altworld 发布的 Hemmingway-127B 参数基于 Qwen3.8-27B 微调262,144 token 上下文声称自己解决的就是这个问题——你要的是正文不是备忘录。它在自己构建的 Human-Likeness 与 CommunicationBench 两轮盲测中双双登顶前者像真人写的领先第二名 26 分后者综合实用分领先 GPT-6 Astra 50 分。人味这种抽象评价如何被量化成一个分数自建基准的第一名又有几分可信本文拆解这两个基准的构造逻辑结合仓库中的 README.md、config.json 与 chat_template.jinja 源码逐层检验类人与好用这两套评价体系的偏差并追问盲测第一是否等于日常写作体验第一。一、像人写的是怎么被量化的Human-Likeness 的测量逻辑在 README.md 中写得很直白从真实请求中取出 80 条写给房东的、拖了很久没写的难开口留言把 Hemmingway-1 的答案与另一个模型的答案配对顺序打乱后交给裁判裁判不知道哪份出自谁。判定标准只有一个问题这两份里哪一份是真人写的。这套设计有几点值得肯定双盲配对裁判面对的是 A/B 对而非逐个打分避免了绝对评分里的锚定效应——模型生成的文本在绝对量级上都很机器只有相对比较才能暴露差异双向顺序run in both orders同一对组合按两种先后顺序各跑一遍排除先看的那份更占优的位置偏差独立裁判README 明确the judge was a different model from the ones being judged防止模型自我偏好污染评分。结果是 Hemmingway-1 以 26 分的领先优势成为最像人写的那个。注意这里的基准定义它测的不是好不好而是文本指纹层面的拟真度——句式冗余度、口头语气、结构是否像普通人在手机里随手打出来的。一个像人的答案未必是最优解但一定是最低感知成本的那个。二、CommunicationBench不仅要像还要好用如果说 Human-Likeness 问的是谁像人CommunicationBench 问的则是谁的答案更好。同一批 80 条请求、同样的双盲配对与双向顺序只是裁判的判定标准从哪份是人写的换成哪份答得更好。结果同样登顶击败 Fable 5.1领先 GPT-6 Astra 五十分Kimi K3、GLM-5.3、Grok 4.6、DeepSeek V4 Pro 全部排在其后——这是一份 27B 参数模型交出的成绩单。按场景细分README 的分类热力图它的优势集中在金钱与行政、职场沟通、难开口的请求、说服对方回心转意这几类高摩擦场景其中难开口请求hard asks的拟真率高达 72%而 GPT-6 Astra 只有 9%。更有信息量的是 README.md 里单独列出的正文是否被埋没统计Fable 5、GLM-5.3 和 Kimi K3 在超过九成的回复里把真正要写的正文埋在开场白、选项列表和解释性注释之后。这张图揭示了一个关键事实CommunicationBench 的高分很大一部分来自**直给正文**——README 的原话是Hemmingway-1 just gives you the text。不铺垫、不列选项、不解释自己在干什么这是它既像人又好用的共同来源。三、类人与好用之间的统计偏差两个基准第一看似互相印证但必须指出像人与好用是两个不同的统计维度正相关不等于因果。类人得分高的部分原因是低信息冗余。真人短信的特点就是省事没有开场白、没有自我解释、直接给出诉求。模型只要学会克制在这两项基准上都会显著加分。这意味着部分分数反映的是修辞节俭度而非真正的理解人情世故。反向证据来自它输掉的场景。README 坦承它在敌对叙事hostile storytelling和长故事轮次long story turns上输给专门的叙事模型——故事模型的输出在这些场景里更好用却不像日常人话。同一个模型的类人分在叙事场景明显回落说明类人度是一个场景相关的局部属性而不是通用能力。情商与类人并不等价。仓库引用的第三方基准 EQ-Bench 4emotional-intelligence benchmark由独立 harness 运行中Hemmingway-1 排名第三超过 GPT-5.5、Opus 4.7 与 Opus 4.8但与榜首仍差 12 分以内——它像人却在纯粹的情商竞技上不是第一。把这三个证据放一起结论是类人分数衡量的是一种社会语言学层面的拟真与解决沟通摩擦高度相关但不等同于所有维度都更好。它在窄场景日常消息、邮件、短文本沟通里几乎等价于好用一旦离开这个场景相关性就会断裂。四、源码侧凭什么读起来轻高分背后有没有工程支撑仓库 config.json 给出了答案。模型是 64 层的 Qwen3_5ForCausalLMarchitectures: [Qwen3_5ForCausalLM]采用 3:1 混合注意力结构layer_types中每 4 层里有 3 层linear_attention、1 层full_attentionfull_attention_interval: 4线性注意力层还带卷积核linear_conv_kernel_dim: 4。这种线性为主、全注意力为辅的架构正是支撑max_position_embeddings: 262144262K 上下文的物理基础——全注意力在这种长度下 KV 缓存会爆炸线性注意力则让长上下文变得廉价。model.safetensors.index.json 的元数据同时揭示了两个细节total_parameters: 26895998464约 26.9B27B的说法属实且权重表中单独挂载了mtp.*模块model-mtp.safetensors对应mtp_num_hidden_layers: 1即多 token 预测MTP推测解码层——这是为低延迟、轻量场景服务的部署优化。生成配置 generation_config.json 也透露了人味的来源temperature: 1.0、top_k: 20、top_p: 0.95、do_sample: true保守采样配合有限的 top-k 截断在稳定性与自然度之间取平衡——既不会像贪心解码那样呆板重复也不至于发散成不知所云的段落。对话层由 chat_template.jinja 控制三档思考强度reasoning_effort支持xhigh/medium/low历史思考块可裁剪preserve_thinking工具调用采用 XML 风格的tool_call格式并支持多步工具调用链。这些设计共同指向一个目标把推理过程压缩、把输出正文前置——与直给正文的基准设定一脉相承。值得一提的是社区情报中的一处信息出入多篇中文社区文章将 Hemmingway-1 的许可描述为 Apache-2.0但仓库 LICENSE 与 README.md 明确写的是CC BY-NC 4.0非商用免费商用需单独协议。此类事实应以仓库为准这也是评估任何模型时建议回查原始仓库的原因。五、含金量追问第一名的三个前提回到最初的问题。Human-Likeness 第一名的含金量取决于三个前提是否成立前提一基准是自建的。README 在 The fine print 一节主动披露CommunicationBench、Human-Likeness、StoryBench 都是 Altworld 自己构建、自己运行、自己评分的只有 EQ-Bench 4 是第三方。自建基准的优势是能精确度量想优化的场景风险是指标对齐——训练目标与提示策略可能逐步拟合基准偏好形成刷分。双盲、双向、独立裁判的方法论设计部分对冲了这种风险但无法完全消除基准是我定的这一根本张力。前提二样本与语言有边界。80 条真实请求是可信的质性样本但统计上不构成大样本且模型 English-firsttokenizer_config.json 与模板均以英文交互为主。中文日常沟通的人味表现不在这次跑分的覆盖范围内。前提三裁判是模型不是人。更像人写的这一判定由另一模型做出。模型对拟真度的感知与真人评分者高度相关但并非完全一致——真人会更在意上下文契合度与语气细微偏差模型裁判更易受表层句式特征影响。综合来看这次第一名的合理解读是它证明 Hemmingway-1 在日常消息写作这一窄场景下产出最接近真人自然表达、且摩擦成本最低——这个结论在方法设计上站得住在场景界定上诚实在工程上轻量混合注意力、直给正文的训练目标有据可查。它不证明该模型在所有写作场景全面领先——叙事场景的落败、EQ-Bench 第三、80 条英文样本与自建基准的性质都是它在含金量上的扣分项。对普通使用者而言最可靠的验证方式不是看分数而是拿自己真实要发的消息去试把模型输出复制进对话框看看敢不敢直接点发送。当点击发送这件事不再需要删掉一段开场白、三个选项和一个道歉式结尾时那个抽象的人味分数才算真正落了地。【免费下载链接】Hemmingway-1项目地址: https://ai.gitcode.com/hf_mirrors/Altworld/Hemmingway-1创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考