WAIC 2026 刚散场,书生S2-397B 就靠“追平万亿参数“刷屏了
WAIC 2026 刚散场书生S2-397B 就靠追平万亿参数刷屏了【免费下载链接】Intern-S2-397B项目地址: https://ai.gitcode.com/InternLM/Intern-S2-397BWAIC 2026 的聚光灯还落在周伯文主旨演讲里那句AI 科学元认知时刻上上海 AI Lab 的开源社区已经开始被一个新名字刷屏Intern-S2-397B——书生系列迄今最强的科学智能多模态基座模型一个 397B 参数的 MoE宣称在多项科学基准上追平万亿参数级的 Intern-S1-Pro。这个说法为什么能炸场它的评测口径是什么、边界在哪里、底层架构又藏着什么工程细节本文直接从模型仓库的 config、分词器与部署文档出发把这场以小博大的热度拆成可验证的技术事实。一、从科学元认知时刻到端砚平台S2-397B 在发布版图中的位置先交代现场背景。WAIC 2026 期间多家媒体央广财经、人民政协网、21财经、界面等集中报道了周伯文的主旨演讲他提出迎接 AI 的科学元认知时刻并发布了面向科学发现源头创新的书生·端砚平台定位是让普通人也能借助 AI 开展科学研究浦江实验室同期宣布发力打造 AI 时代的隐形基石。端砚平台回答的是谁在用、怎么用而 Intern-S2-397B 回答的是底层是谁在干活。仓库 README.md 的开篇给 S2-397B 的定位一句话面向科学智能scientific intelligence与长程 Agentlong-horizon agents的最强多模态基座模型。它沿三个维度做 scaling视觉原生预训练直接从科学文献的原始页面raw pages学习在共享表征空间里同时建模符号语义与视觉关系跳过中间解析环节保留图文对应关系强化空间与视觉推理科学任务强化学习覆盖 20 科学领域的多任务 RL 联合训练官方称其在开源模型中达到领先的通用推理表现并在生物分子互作设计、材料结构生成等专业任务上有强结果长程智能体 RL把多个 Agent 框架接入大规模沙盒环境做黑盒 agentic 强化学习抬高通用与科学域长程任务的能力上限。换句话说端砚是应用层的操作台S2-397B 是被开源出来、可以自托管的发动机。Apache-2.0 许可见 LICENSE意味着这条链路从模型权重到 API 形态全部开放这也是社区讨论度高的前提之一。二、拆 config397B MoE 的骨架长什么样营销话术之外config.json 才是理解这个模型最硬的证据。几个关键数字维度配置值含义architecturesQwen3_5MoeForConditionalGeneration基于 Qwen3.5 MoE 条件的多模态架构num_hidden_layers60文本主干共 60 层num_experts/num_experts_per_tok512 / 10每 token 只激活 512 个专家中的 10 个外加 1 个共享专家shared_expert_intermediate_size: 1024layer_typeslinear_attention× 3 full_attention× 1 循环每 4 层中仅 1 层全注意力full_attention_interval: 4其余为线性注意力——长上下文的成本被结构性压低mtp_num_hidden_layers1内置一层 Multi-Token Prediction为推测解码打底max_position_embeddings262144原生 256K 上下文vocab_size251392基础词表 科学模态扩展区vision_config.depth2727 层视觉编码器patch_size: 16temporal_patch_size: 2三个值得展开的工程点1. 混合注意力Gated/Linear Full是256K 上下文不烧钱的关键。layer_types里 45 层线性注意力、15 层全注意力线性侧用linear_conv_kernel_dim: 4、linear_num_value_heads: 64等参数实现类 Mamba 的低成本状态传递mamba_ssm_dtype: float32。这就是为什么官方敢把评测口径推到文本推理 256K 最大推理长度README 中明确文本推理基准最大推理长度 256K tokens多模态基准 64K tokens。2. MTP 不是外挂技巧而是训练时就在主干里的。mtp_num_hidden_layers: 1表明多 token 预测头是一等公民。部署侧三个框架都给出了 MTP 推测解码配方deployment_guide.mdLMDeploy 用--speculative-algorithm qwen3_5_mtp --speculative-num-draft-tokens 4vLLM 用--speculative-config {method:mtp,num_speculative_tokens:3}SGLang 则走--speculative-algo NEXTN配合 4 个 draft token。社区此前对 S2-Preview 系列 8×H200 环境的实测MTP 在 16K 输出长度下吞吐接近翻倍、TPOT 大幅下降说明这条加速链路是真实可用的。3. 视觉塔与 397B 的关系。vision_config中 27 层 ViT 把 16×16 patch2×2 时空合并映射到 4096 维主干。视觉塔参数量相对 397B 主干很小多模态在这里主要吃的是主干的 MoE 容量——这与视觉原生预训练直接从文献页面学的范式自洽页面级图文混合输入靠的是文本侧的建模能力兜底。再看 README.md 推荐的采样参数top_p0.95, top_k50, min_p0.0, temperature0.8与 generation_config.json 的出厂默认temperature0.6, top_k20不一致——官方明确建议以 README 参数为准这也是部署时一个容易踩的坑。三、科学模态不是营销词分词器里实打实的 SMILES / PROT / XNA科学大模型最容易沦为贴标签。但这个仓库里科学模态是长在 tokenizer 里的。tokenizer_config.json 声明了三个独立的 SentencePiece 子分词器及其词表偏移offset_SMILES: 248102, offset_PROT: 249126, offset_XNA: 250150对应仓库根目录下的 tokenizer_SMILES.model、tokenizer_PROT.model、tokenizer_XNA.model 三个 SPM 模型由自定义 tokenizertokenization_interns1.py中的InternS1Tokenizertokenizer_class在prepare_extra_tokenizers里加载SMILES分子从 248102 起、蛋白序列从 249126 起、DNA/XNA 从 250150 起各自占据词表的高位区间。词表里还能看到成对的任务定界符SMILES//SMILES、protein//protein、dna//dna、rna//rna。更进一步tokenization_interns1.py 实现了三个自动检测模块SmilesCheckModule正则 括号/环号合法性校验fast/slow 双通道自动把裸文本里的合法 SMILES 串包进SMILES_AUTO_DETECTProtCheckModule蛋白序列自动识别最小长度 27XnaCheckModuleXNA 序列自动识别。也就是说用户不需要手动加定界符分词器会把输入中合法的科学序列识别—校验—切进专属子词表。这对分子坐标回归、晶体结构生成这类任务的意义是原子与键的表示在 token 级就是紧凑且无歧义的而不是被通用 BPE 切碎成噪声。同样长在这套机制里的还有时间序列模态。chat_template.jinja 中显式处理了time_series类型的 content 项渲染为|ts|TS_CONTEXT|/ts|占位结构词表中对应|ts|、TS_CONTEXT、TS_GEN等专用 token并且当消息含时序数据或显式关闭思考模式时模板会注入空的think\n\n/think直接跳过推理。README 给出的地震 P/S 波检波与电力负荷预测示例中预测请求通过extra_body传enable_forecasting: True和forecast_horizon响应体里多出ts_forecast.point_forecast/quantile_forecast字段——时序预测已经是一种结构化的输出协议而不是让模型口算数字。需要注意的边界README 明确写了Time series inference is currently only supported in LMDeploy。时序能力的部署路径目前是单框架独占这一点在选型时要算进去。四、追平万亿参数的说法从哪来评测口径与适用边界先把传播链条理清楚。397B 追平万亿这个叙事不是凭空冒出来的它建立在一条完整的证据线上前身铺垫社区CSDN 多篇2026 年 1 月至 6 月早已围绕 35B 的 Intern-S2-Preview 反复讨论35B 参数如何超越万亿级模型——对标物正是万亿参数级的 Intern-S1-Pro论据包括 MolecularIQ 57.26 分媒体称超过 Gemini-3.1-Pro、晶体结构生成通过率超 40% 等。397B 是这条小模型追平万亿路线上的放大版话题延续性天然存在媒体引爆WAIC 2026 期间网易科技等以《397B 参数追平万亿模型上海 AI Lab 发布科学智能体新基座》为题跟进报道追平二字被直接做进标题成为传播钩子仓库自证README.md 的 Performance 一节给出了对比图上文配图并注明评测协议——使用 OpenCompass、VLMEvalKit、AgentCompass 三个框架跑全部模型文本推理基准最大推理长度 256K tokens多模态基准 64K tokens图例约定下划线为开源模型最佳、加粗为全模型最佳。把口径拆开追平至少有三条适用边界读者引用前应当明确对标对象是科学基准而非通用榜单。万亿指的是 Intern-S1-Pro 这一档科学旗舰。开源阵营里最佳下划线与全模型最佳加粗是两档结论README 只说 S2-397B 在科学任务上强、通用推理在开源中领先并不等于在所有闭源旗舰前面全面胜出长推理预算是成绩的一部分。256K 的最大推理长度意味着思考型任务可以消耗大量 token 换正确率。对延迟敏感的服务化场景同等硬件下的单请求成本会显著高于 32K/64K 口径的对比对比图细节以仓库图片为准。本仓库中figs/intern-s2-397b.jpg由 Git LFS 托管逐项分数请以上文配图的渲染版本为准本文不做逐格转述避免二手失真。部署侧的边界同样具体deployment_guide.md 的官方推荐配置是H100×8 或 H200×8节点FP8 权重internlm/Intern-S2-FP8配 LMDeploy--dp 4 --ep 8、vLLM/SGLang--tensor-parallel-size 8若要把上下文从 256K 拉到 512K需要显式叠加 YaRN RoPE 覆盖--hf-overrides里rope_type: yarn, factor: 4.0, original_max_position_embeddings: 262144vLLM 侧还要VLLM_ALLOW_LONG_MAX_MODEL_LEN1。追平万亿的前提是你得起动一个八卡节点。五、对国产科学大模型叙事意味着什么这波刷屏真正的信息量不在又一个大模型发布而在三件事第一参数效率叙事从口号变成了可复现的架构事实。512 专家 top-10 激活的 MoE 3:1 线性/全注意力混合 训练期内置 MTP这组配置解释了为什么 397B 敢对标万亿激活参数远小于总参数长上下文的边际成本被注意力结构压低解码吞吐被 MTP 拉回。社区对 S2 系列的实测MTP 长输出下吞吐接近翻倍与部署文档中的默认 MTP 配方互相印证。国产科学模型第一次不用堆到万亿来兑现旗舰表现这对算力受限的团队是实质性利好。第二科学能力下沉到 tokenizer 与协议层而不是 prompt 层。SMILES/PROT/XNA 三路子词表加自动检测、时序数据的结构化输入输出协议ts_forecast分位数预测、思考/非思考模式在 chat_template.jinja 里的一等公民地位enable_thinkingFalse时模板自动折叠思考块——这些意味着科学任务被当作训练目标 表示问题解决而不是给个提示词看看。对比 S1-Pro 时代需要外部工具链拼装分子表示的做法工程上的护城河加深了一层。第三Agent 化与本地化部署构成了科学数据的现实出口。README 的 Agent Integration 一节给出了两条完整路径自托管LMDeploy 的 OpenAI 兼容端点http://0.0.0.0:23333/v1并提示用--tool-call-parser interns2-preview解析工具调用与官方 APIOpenAI 兼容 Anthropic 兼容双网关可直接接 Claude Code。工具调用格式在 chat_template 里是 XML 风格的 【免费下载链接】Intern-S2-397B项目地址: https://ai.gitcode.com/InternLM/Intern-S2-397B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

电脑开机无反应与蓝屏故障的物理层诊断方法

电脑开机无反应与蓝屏故障的物理层诊断方法

1. 这不是教科书,是修了327台故障机后撕下来的笔记本内页“蓝屏”和“开机无反应”这两个词,在维修现场从来不是孤立的故障现象,而是两套完全不同的语言系统——前者是系统在崩溃前发出的求救电报,后者是整条供电链路突然失联的静…

2026/10/10 12:00:36 阅读更多 →
合伙人制落地难?一文讲透分红规则引擎与系统设计

合伙人制落地难?一文讲透分红规则引擎与系统设计

去年我接触过一个做本地生活服务的品牌方,老板想搞"合伙人制",说了这么一句话:让核心销售和管理骨干出人、出钱、帮公司搞流量做成交,把公司的事当自己的事。想法很好,但他只给我一页手写的分红方案&#xf…

2026/10/10 12:00:36 阅读更多 →
串口服务器在信号机联网改造中的部署与调试实战指南

串口服务器在信号机联网改造中的部署与调试实战指南

前一段时间,我在一个路口做信号控制系统的联网改造。那边信号机用了快十年,只有RS-232和RS-485串口接口,而中心平台早就全面IP化了,现场到机房之间走的是光纤环网。怎么把这几台老设备接进网络,让中心能实时读取灯态、…

2026/10/10 12:00:36 阅读更多 →

最新新闻

Iris数据集K-Means聚类实战:归一化、评估与避坑指南

Iris数据集K-Means聚类实战:归一化、评估与避坑指南

简介:本资源是一个面向机器学习初学者与数据科学入门者的K-Means聚类实践项目,聚焦经典Iris鸢尾花数据集的无监督聚类分析,帮助读者理解聚类原理、算法实现与结果评估全流程。压缩包共2个文件(1个CSV数据文件、1个Python脚本&…

2026/10/10 12:54:44 阅读更多 →
SSR与Hydration:摊开讲透的底层逻辑与性能平衡艺术

SSR与Hydration:摊开讲透的底层逻辑与性能平衡艺术

很多做前端的同学一聊到服务端渲染,第一反应都是“为了SEO”、“首屏快一点”,然后就直接往项目里怼了一个 SSR 框架。等到真正上线才发现,事情远没有想象的那么简单:页面确实更快出来了,但按钮点了半天没反应&#xf…

2026/10/10 12:54:44 阅读更多 →
去中心化AI决策机制:从信任模型到工程落地的完整拆解

去中心化AI决策机制:从信任模型到工程落地的完整拆解

1. 先看地基:去中心化系统给AI准备的决策环境聊AI决策,大家首先想到的往往是中心化场景:数据集中在一台服务器上,模型由一家公司训练和部署,用户提交请求之后,后台跑推理,最后返回结果。这个链路…

2026/10/10 12:54:44 阅读更多 →
从“无标题”到落地:项目定义、命名与章程实操指南

从“无标题”到落地:项目定义、命名与章程实操指南

项目标题写着“无标题”——这不是刻意玩梗,而是很多项目最初的真实状态。我见过不少同事,建了一个文件夹叫“新建文件夹”,代码仓库叫test123,PPT封面留着“无标题”三个字,结果项目跑了两周,所有人都开始…

2026/10/10 12:54:43 阅读更多 →
Ubuntu 22.04 安装 MySQL 8.0:从 apt 部署到远程连接与踩坑实战

Ubuntu 22.04 安装 MySQL 8.0:从 apt 部署到远程连接与踩坑实战

最近帮同事把几台测试服务器上的MySQL重新收拾了一遍,清一色都是Ubuntu 22.04。说起来“安装MySQL”这件事,在很多教程里就是两三条命令的事,自己上手才知道坑一个接一个:装完root登不进去、字符集乱码、外面连不上,甚…

2026/10/10 12:54:43 阅读更多 →
UVM编译链路全解析:从uvm_pkg.sv到仿真器自动编译的秘密

UVM编译链路全解析:从uvm_pkg.sv到仿真器自动编译的秘密

入行头两年我看公司的仿真Makefile,最让我犯嘀咕的就是第一行:vcs -sverilog -ntb_opts uvm ...。那会儿我一直没搞明白,我自己的tb文件我是认得的,UVM那一堆类库从哪来的?为什么我不写include "uvm_pkg.sv"…

2026/10/10 12:53:42 阅读更多 →

日新闻

卫星轨道分类全解析:从LEO到GEO的选型逻辑与工程实践

卫星轨道分类全解析:从LEO到GEO的选型逻辑与工程实践

1. 从“卫星轨道分类”这个标题说起:为什么值得花时间搞懂第一次接触“卫星轨道分类”这个概念,很多人会觉得它离自己很远——不就是天上的星星怎么转吗?但如果你正在做航天任务规划、遥感数据接收、星座设计,甚至只是准备一场航天…

2026/10/10 0:00:39 阅读更多 →
Spring AOP 核心原理与实战:从概念到日志切面落地

Spring AOP 核心原理与实战:从概念到日志切面落地

1. 从一个真实痛点说起:为什么你的代码里到处都是重复逻辑刚入行那会儿,我写过一个用户管理模块,注册、登录、改密码、注销四个接口。每个接口里都塞了几乎一样的日志打印、参数校验、事务开启和提交。当时觉得没什么,能跑就行。直…

2026/10/10 0:00:40 阅读更多 →
Python招聘数据采集与分析可视化:从采集清洗到薪资技能城市可视化全链路

Python招聘数据采集与分析可视化:从采集清洗到薪资技能城市可视化全链路

简介:这是一套面向计算机相关专业学生与项目实战学习者的Python数据采集与分析可视化完整项目,以Boss直聘岗位数据为对象,适合用作毕业设计、课程设计或期末大作业。资源包共38个文件,约246KB,以13个py源码文件为核心&…

2026/10/10 0:00:40 阅读更多 →

周新闻

KT148A语音芯片外挂8002D功放的工程实践指南

KT148A语音芯片外挂8002D功放的工程实践指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 11:14:25 阅读更多 →
LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 1:36:08 阅读更多 →
ARM架构深度解析:从RISC设计理念到交叉编译实战

ARM架构深度解析:从RISC设计理念到交叉编译实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 11:14:58 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 5:23:50 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/9 21:32:20 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 10:38:42 阅读更多 →