大模型预训练新范式——视觉预训练反哺语言智能
“柏拉图表征假说”提出文字与图像并非彼此割裂的信息形态而是同一底层现实在不同模态中的投影。知识也从不只栖身于文字。科学文献、教材与专业书籍本就是图文交织的知识载体示意图呈现运行机制分子结构记录空间构型几何图形揭示位置关系统计曲线刻画变化趋势—它们以各自的方式共同表达着自然规律。文字可以描述和转述这些信息却难以无损地保留其中的空间结构与视觉逻辑。因此当模型仅从文本中学习时它所接触到的或许只是科学知识的一种投影而非知识的完整形态。然而当前大语言模型 (LLM) 的主流预训练范式仍以纯文本上的“下一词预测”为核心。文档、网页等视觉信息丰富的知识载体通常需要先经过 OCR 与文档解析被转换为一维的文本序列后才能进入模型。这种处理方式便于规模化训练却也在无形中舍弃了原始内容中的版面结构、图文关系、公式形态与空间逻辑使模型读到的知识从一开始便不再完整。一项来自上海人工智能实验室和国内高校的联合研究挑战了“语言模型必须基于纯文本表征进行预训练”的默认假设。研究团队提出了一种视觉预训练范式通过在连续视觉表征空间中预测下一个视觉单元模型得以直接从视觉文档中获取知识。该研究基于国产昇腾算力平台开展并完成了面向大规模训练场景的系统适配与优化。相关技术已应用于上海人工智能实验室的科学多模态基础大模型书生Intern-S2-Preview 35B/397B系列模型的预训练有效提升了模型科学推理和多模态理解能力。论文标题Scalable Visual Pretraining for Language Intelligence论文链接https://arxiv.org/abs/2607.09657HuggingFace链接https://huggingface.co/papers/2607.0965735B模型链接:https://huggingface.co/internlm/Intern-S2-Preview397B模型链接:https://huggingface.co/internlm/Intern-S2-Preview-397B图1在统一表征空间进行视觉预训练图2相同语料在视觉预训练和文本预训练对比示意图实验发现发现一从视觉文档中也能学到更强的语言智能研究首先验证了一个核心预期如果原始文档页面比解析后的纯文本保留了更完整的知识那么直接从这些视觉文档中学习也应当为模型带来更强的科学推理能力。实验结果验证了这一判断。在保持科学文献来源、初始模型、训练设置和监督微调数据完全一致的情况下VP 在 MMLU-Pro、GPQA Diamond、AIME 2025 和 HLE 等纯文本推理基准上全面优于使用解析文本训练的 TP。该趋势在 Qwen3.5、Qwen3、Llama 3.2 Vision 和 Llama 3.1 等不同模型架构上均稳定出现其中 GPQA Diamond 最多提升 3.22 分MMLU-Pro 最多提升约 2.1 分。图3视觉预训练和基线的模型能力评测对比这正是视觉预训练希望实现的目标输入模型的虽然是文档页面但模型学习到的并不只是图像的表面特征而是公式、图表、空间关系与文本内容共同承载的知识。这些最终体现为更强的语言推理能力。换言之语言智能并不只能从语言中习得。只要建立合适的预测目标视觉同样可以成为基础模型学习知识、形成推理能力的有效载体。发现二视觉预训练的收益随训练规模持续增长呼应Scaling law一种预训练范式能否支撑基础模型发展关键不仅在于它是否有效更在于它能否从不断扩大的数据与计算规模中持续获益。实验表明VP展现出了清晰的 Scaling 趋势随着科学文档训练量持续增加VP 相对于文本预训练的优势并未趋于饱和而是在 MMLU-Pro、GPQA Diamond 和 AIME 2025 等多个基准上稳定扩大。在完整训练规模下VP 相对于初始模型的能力增益分别达到文本预训练的 1.27 倍、2.02 倍和 2.88 倍。图4视觉预训练增益随着训练规模增大这意味着模型读取的视觉文档越多从公式、图表、空间结构与复杂版面中吸收的知识也越丰富并能够进一步转化为不断增长的语言推理能力。视觉预训练因此不只是一个在有限数据上有效的训练目标也展现出了成为可扩展基础模型预训练范式的潜力。进一步分析显示VP 的收益与页面中的视觉结构密度密切相关。在以文字为主、视觉结构较少的样本上VP 与文本预训练表现接近随着公式、图表、表格与复杂版面的占比增加VP 的优势显著扩大。这说明VP 的收益并非简单来自额外训练而主要来自文本解析难以完整保留的视觉与空间信息。更重要的是这种增长建立在更紧凑的视觉表示之上。对于完全相同的科学 PDF解析后的文本约包含 800 亿个 Token而经过前景筛选的视觉表示仅包含约 200 亿个视觉 Token。换言之VP 仅使用约四分之一的文档 Token便取得了超过文本预训练的效果体现出更高的信息密度与扩展效率。发现三无需显式图文配对监督也能促进跨模态对齐传统多模态预训练通常依赖大量图文对、图片描述或人工标注。VP 使用的却只是未经标注的原始文档页面没有显式的图文配对监督。尽管如此经过视觉预训练后模型中的视觉与文字表征仍然变得更加接近配对图文表征的余弦相似度由 0.631 提升至 0.907表征空间的全局结构与局部邻域也呈现出更强的一致性。图5视觉预训练和基线的模型多模态能力评测对比这种跨模态对齐进一步迁移到了实际任务中。在 MMMU-Pro、SFE、ChartQAPro 和 MathVista 等多模态基准上VP 在不同模型架构下均优于匹配的文本预训练其中ChartQAPro 提升约 5.4 分MathVista 最多提升 4.8 分。这意味着即使不依赖人工构造的图文对模型也可能通过预测原始文档中的视觉内容在已有语言知识与视觉结构之间建立联系。方法介绍视觉预训练的核心是 Next visual latent prediction。首先原始 PDF 被直接渲染为页面图像并通过冻结的视觉编码器转换为一系列连续的视觉表征。系统过滤页边距、空白区域等低信息 Patch同时保留前景内容的空间位置将其输入语言模型。训练过程中文本与视觉文档共享同一个自回归模型文本数据仍然采用“下一词预测”视觉文档则采用“下一视觉表征预测”。通过这种方式模型在保留原有语言学习能力的同时也能在不依赖 OCR 文本提取、人工标注或显式图文配对的情况下直接从原始文档页面中吸收知识。与直接生成原始像素不同VP 预测的是冻结视觉编码器提取的连续潜表征。这一目标弱化了颜色噪声、像素偏差等低层细节的影响而能够更多地学习视觉内容所承载的知识例如公式中的符号关系、图表中的变量关联与变化规律、表格中的多维对应以及复杂版面中的跨区域逻辑。关键的是文字与视觉文档训练的是同一个自回归模型。视觉预测产生的训练信号会直接更新承载语言能力的共享模型参数使视觉文档中的知识不只是停留在外部视觉编码器中而是逐步进入语言模型的内部表征空间。经过后续的文本监督微调这些从视觉文档中获得的知识便可以通过语言形式被重新组织和调用并最终体现在科学推理任务上。展望从“阅读文字”到“预测世界”这些实验共同指向一个结论从预测语言的下一个符号到预测世界的下一种表征基础模型正在获得一种超越文字的学习方式。未来随着预测目标进一步拓展到图像、视频与交互数据模型或许能够逐步建立对现实更完整的内部表征。视觉预训练正是迈向这一方向的一步——改变的不只是进入模型的数据形式更是模型获取知识、建立预测与理解世界的方式。

相关新闻

【JAVA毕设源码分享】基于springboot个人物品管理系统的设计与实现(程序+文档+代码讲解+一条龙定制)

【JAVA毕设源码分享】基于springboot个人物品管理系统的设计与实现(程序+文档+代码讲解+一条龙定制)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

2026/7/23 17:16:07 阅读更多 →
[实战指南] 制造业质量管理中的5Why分析法:从图纸偏差到根本原因定位

[实战指南] 制造业质量管理中的5Why分析法:从图纸偏差到根本原因定位

在 2026 年的数字化工厂中,5Why 分析法(5Why root cause analysis)依然是质量工程师解决生产偏离、提升过程能力(Cpk)的核心工具。面对复杂的精密制造环境,如何通过逻辑严密的追问挖掘出隐藏在图纸标注与加…

2026/7/23 17:16:07 阅读更多 →
【JAVA毕设源码分享】基于springboot基层智能化人员调度系统的设计与实现(程序+文档+代码讲解+一条龙定制)

【JAVA毕设源码分享】基于springboot基层智能化人员调度系统的设计与实现(程序+文档+代码讲解+一条龙定制)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

2026/7/23 17:16:07 阅读更多 →

最新新闻

制造业中小工厂CRM选型指南与实施策略

制造业中小工厂CRM选型指南与实施策略

1. 项目概述2026年制造业中小工厂的CRM选型是一个需要谨慎对待的关键决策。作为深耕制造业信息化领域多年的从业者,我见过太多工厂在CRM选型上踩坑的案例——从功能冗余导致系统闲置,到数据孤岛造成管理混乱,再到后期维护成本超出预算等问题层…

2026/7/23 17:28:13 阅读更多 →
2026年实测:宁波4大周末语文小升初机构综合评测

2026年实测:宁波4大周末语文小升初机构综合评测

在宁波,教育资源集聚的镇海、海曙、鄞州等区域,每一年的升学季都牵动着无数家庭的神经。尤其是周末的语文小升初辅导,早已成为家长群里的高频热词。面对铺天盖地的招生宣传,真正让宁波家长焦虑的,往往不是‘报不报’&a…

2026/7/23 17:28:13 阅读更多 →
ARM Cortex-M4F异常与中断机制详解:从NVIC原理到实战调试

ARM Cortex-M4F异常与中断机制详解:从NVIC原理到实战调试

1. 项目概述:深入ARM Cortex-M4F的异常与中断世界在嵌入式系统开发,尤其是实时操作系统(RTOS)和裸机应用中,异常与中断处理机制是决定系统响应性、可靠性和效率的基石。作为一名长期深耕于ARM Cortex-M系列微控制器开发…

2026/7/23 17:28:13 阅读更多 →
2023年6月全球游戏市场分析与新游评测

2023年6月全球游戏市场分析与新游评测

1. 2023年6月游戏市场概况6月作为暑期档的开端,历来是游戏厂商的必争之地。今年6月全球游戏市场呈现出明显的"大厂扎堆、精品云集"特点,多款3A级作品选择在这个时间节点发售。从平台分布来看,PC和主机平台的新作数量占比达到75%&am…

2026/7/23 17:28:13 阅读更多 →
ARM Cortex-M4F核心寄存器与内存模型详解:中断控制与原子操作实践

ARM Cortex-M4F核心寄存器与内存模型详解:中断控制与原子操作实践

1. 项目概述:深入ARM Cortex-M4F的“心脏”与“血管” 在嵌入式系统,尤其是实时控制领域,我们写的每一行C代码最终都要转化为处理器能理解的指令和数据流。这个转化过程并非发生在真空里,而是被一个精密的“指挥中心”和一套复杂的…

2026/7/23 17:28:13 阅读更多 →
在Ubuntu 18.04(实体机)上配置OpenWRT的开发环境

在Ubuntu 18.04(实体机)上配置OpenWRT的开发环境

广西河池学院 广西高校重点实验室培训基地 系统控制与信息处理重点实验室 本篇博客来自河池学院:OpenWRT无线路由组 写作时间:2020年7月28日20:26:40 在Ubuntu 18.04(实体机)上配置OpenWRT的开发环境 一、安装虚拟机(实…

2026/7/23 17:27:13 阅读更多 →

日新闻

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

更多请点击: https://intelliparadigm.com 第一章:从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表) 当AI副业主理人不再仅满足于单次服务交付,而是主动构建可复用、可裂变、可…

2026/7/23 0:00:25 阅读更多 →
AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

更多请点击: https://codechina.net 第一章:AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析 在对2,346篇跨行业AI生成文案的A/B测试数据进行聚类分析后,我们发现&#xff1…

2026/7/23 0:01:26 阅读更多 →
Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具 【免费下载链接】chitchatter Secure peer-to-peer chat that is serverless, decentralized, and ephemeral 项目地址: https://gitcode.com/gh_mirrors/ch/chitchatter Chitchatter是一款革命性的安…

2026/7/23 0:01:26 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/22 8:58:19 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/22 19:43:43 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/22 12:54:44 阅读更多 →

月新闻