华为云行业大模型团队AI PPT登顶PresentBench榜单
近日华为云行业大模型多模态智能团队参评的AI PPT(hwc-mmi-aippt)登顶权威评测榜单在清华大学团队发布的细粒度幻灯片生成评测基准PresentBench公开排行榜中以70.8分的成绩位列总榜第一刷新榜单。该能力面向复杂材料的自动解析、内容策划、页面生成与质量校验帮助用户完成从“给定材料”到“交付演示文稿”的全流程创作。此次登顶标志着该能力在材料理解、内容完整性、事实正确性和演示表达等维度上的综合实力得到权威验证。榜单成绩基于238个真实案例的平均聚合结果覆盖学术、教育、经济、演讲和广告五大场景。▲PresentBench: A Fine-Grained Rubric-Based Benchmark for Slide Generation公开榜单显示hwc-mmi-aippt跃居榜首一、PresentBench重新定义“好PPT”的评价标准PresentBench由清华大学团队发布全称为“A Fine-Grained Rubric-Based Benchmark for Slide Generation”——即一个细粒度的、基于评分量表的幻灯片生成评测基准。与仅依据整体观感打分的传统评测不同PresentBench关注的核心并非“这套PPT看起来是否美观”而是它是否真正完成了一项真实的演示文稿创作任务能否理解用户材料、能否准确提炼内容、能否形成清晰叙事、能否以恰当的视觉方式完成交付。为此清华大学团队构建了238个专家筛选的真实评测实例覆盖五大场景学术类 91个教育类 60个经济类 41个演讲类 30个广告类 16个▲PresentBench测评集涵盖学术、教育、经济、演讲、广告五大场景238个真实测评实例任务材料均来自真实来源学术类涵盖ICLR、ICML、CVPR、USENIX等顶级会议论文教育类取材自CMU、MIT等高校课程资料经济与企业类则来自Microsoft、JPMorgan、OECD、World Bank等机构的公开报告与资料。这使得PresentBench不再停留于“给一句主题、生成几页PPT”的简单测试而是一场面向真实工作场景的全流程能力考验。长材料、强约束、逐项核验一场真正的PPT创作能力测试PresentBench的难点首先来自输入材料的复杂度。平均每个任务包含约2.22万Token的输入信息相当于34页原始材料。系统需要从大量分散的事实、数据、图表和结论中提取关键信息、筛选重点、组织叙事而非根据简短提示进行自由生成。其次每个任务均附带高度具体的生成要求。指令会明确规定演示目标、受众、结构、页数范围、必要章节、内容范围、视觉布局与表达风格同时要求所有内容必须基于背景材料禁止编造或篡改事实涉及量化信息时还需能够回溯至原始材料中的具体位置。在评测环节PresentBench为每个任务人工设计了平均54.1条原子化检查项。这些检查项将幻灯片能力拆解为五个独立维度演示基础规范逻辑是否清晰、表达是否简洁、语言是否恰当、是否符合目标场景视觉设计与布局页面是否美观、易读布局是否合理内容完整性任务要求的关键信息是否被完整覆盖内容正确性数据、事实与结论是否准确内容忠实性内容是否真正扎根于背景材料是否存在无依据扩写或“幻觉”。评测时系统对每一条检查项独立给出“满足”或“不满足”的判断并提供定位证据随后计算各维度完成率汇总得出案例得分与最终榜单成绩。这样的机制让模型能力不再停留在模糊的整体评分而是能够被逐项核验、定位问题并追溯原因。五大场景斩获四项第一多维能力全面领先根据PresentBench官网公开排行榜显示hwc-mmi-aippt以70.8分位列总榜第一。五大场景成绩如下学术72.6分排名第一广告60.1分排名第一教育71.0分排名第一经济72.8分排名第一演讲66.5分排名第二从能力维度来看hwc-mmi-aippt在演示基础规范、内容完整性和内容正确性三项中均位列第一得分分别为90.3分、79.9分和72.2分在视觉设计与布局、内容忠实性两项中位列第二得分分别为61.1分和50.3分。▲hwc-mmi-aippt具备从内容解析、内容策划、页面生成到校验交付的全流程智能创作能力上述成绩表明该能力的优势并非来自单一的版式生成能力而是覆盖了材料理解、信息组织、内容表达与演示交付的完整链路。技术解密从“读懂材料”到“生成成品”的全流程智能创作▲hwc-mmi-aippt由multi-Agent驱动内容策划、页面生成与治理闭环的架构原理面对论文、报告、财报、课程资料等复杂输入该能力构建了覆盖“解析—策划—生成—校验—导出”的完整智能创作流程。材料解析。系统从原始文档中提取关键数字、事实、命名实体和引用信息形成结构化的数据资产清单确保后续生成的内容能够尽可能回溯至源材料减少关键信息遗漏和无依据扩写。内容策划。系统围绕用户主题与材料主线自动规划演示结构、章节逻辑和逐页大纲。每一页并非机械罗列信息而是围绕一个核心论点展开应呈现什么重点、采用何种信息组织方式、与前后页面如何衔接。页面生成。在内容规划完成后系统将文字、数据和图表需求转化为逐页页面根据不同的表达任务自动安排标题、数据卡片、图表、说明文字和视觉层级使内容既便于理解也便于讲述与传播。校验交付。系统对生成页面进行字号、溢出、布局和内容完整性等检查并在必要时自动修复最终导出可直接使用的演示文稿。由此AI不仅能够“生成页面”更能够参与完成一套PPT的完整交付过程。五、从自动排版走向智能表达传统PPT制作往往需要经历材料整理、重点提炼、结构搭建、视觉设计和反复修改等多个环节。尤其面对长报告、复杂方案和多源资料时创作者不仅要具备内容理解能力还需兼顾叙事逻辑与设计表达。▲hwc-mmi-aippt已上线OfficeAce支持复杂逻辑流程、海量数据可视化等幻灯片效果示例该能力的价值在于将这些步骤串联为一条可执行的智能创作链路让AI从材料中发现重点、规划表达、生成页面并通过校验提升最终产物的可用性。此次登顶PresentBench标志着AI幻灯片生成正在从“自动化工具”迈向“可信赖的内容生产能力”。未来该能力将持续提升复杂材料理解、内容策划、视觉设计与质量校验能力帮助更多用户从繁琐的PPT制作中释放出来将时间投入到更具价值的判断、沟通与决策之中。能力已上线华为云OfficeAce欢迎下载使用智能体平台_AgentArts_OfficeAce_华为云参考资料PresentBench 官网与公开排行榜https://presentbench.github.io/PresentBench 论文arXiv:2603.07244https://arxiv.org/pdf/2603.07244

相关新闻

行空板M10嵌入式语音合成实战:集成讯飞离线与百度云端双引擎

行空板M10嵌入式语音合成实战:集成讯飞离线与百度云端双引擎

1. 项目缘起:为什么要在行空板上折腾语音引擎?最近在做一个智能交互小装置,核心需求是让设备能“听懂人话”并“开口说话”。手头正好有一块行空板M10,它集成了高性能的处理器和丰富的接口,跑个Linux系统,做…

2026/7/29 6:49:53 阅读更多 →
Android崩溃分析实战:用Python脚本打通Logcat与Firebase Crashlytics

Android崩溃分析实战:用Python脚本打通Logcat与Firebase Crashlytics

1. 项目概述:为什么我们需要一个专门的Logcat插件来分析Firebase崩溃? 如果你是一名Android开发者,尤其是在处理线上应用崩溃问题时,Firebase Crashlytics(现在已整合到Firebase Crash Reporting中)几乎是…

2026/7/29 6:49:53 阅读更多 →
多传感器融合算法:从UKF到AUKF的工程实践

多传感器融合算法:从UKF到AUKF的工程实践

1. 多传感器融合与状态估计的核心挑战在自动驾驶、机器人导航和工业控制等领域,多传感器数据融合一直是提升系统鲁棒性的关键技术。我十年前第一次接触无人机飞控项目时,就深刻体会到单一传感器的局限性——GPS信号丢失时姿态估计完全失效,这…

2026/7/29 6:49:53 阅读更多 →

最新新闻

FPGA FFT IP核实战:从参数配置到调试优化的完整指南

FPGA FFT IP核实战:从参数配置到调试优化的完整指南

1. 项目概述:当FPGA遇上FFT IP核 在数字信号处理的世界里,快速傅里叶变换(FFT)就像一把万能钥匙,能把时域里一团乱麻的信号,清晰地转换到频域,让我们看清它的“成分”。无论是无线通信里的信号解…

2026/7/29 7:01:59 阅读更多 →
从创客社区到硬件创新:蘑菇云英雄谱的入坑故事与成长路径

从创客社区到硬件创新:蘑菇云英雄谱的入坑故事与成长路径

1. 从“蘑菇云”到“英雄谱”:一个创客社区的十年叙事如果你在创客圈子里混迹过一段时间,大概率听说过“蘑菇云”这个名字。它不是一个游戏,也不是一个动漫IP,而是一个真实存在、并且深刻影响了国内无数硬件爱好者、工程师和创业者…

2026/7/29 7:01:59 阅读更多 →
余弦调色板 a+b*cos(6.28*(c*t+d))

余弦调色板 a+b*cos(6.28*(c*t+d))

vec3 palette(float t) {return a b * cos(2*PI * (c * t d)); }参数作用类比a (bias)颜色中心点往亮还是往暗走b (amplitude)振幅 变化范围颜色浓淡跨度c (frequency)频率 t 从 0→1 时循环几圈颜色重复几次d (phase)相位 三通道的错位偏移决定"先出现什么色"C…

2026/7/29 7:01:59 阅读更多 →
Unity协程实战:从打字机到动态时钟的UI动效实现

Unity协程实战:从打字机到动态时钟的UI动效实现

1. 项目概述:从UI动效到协程核心在Unity开发中,UI动效是提升用户体验和游戏沉浸感的关键一环。其中,打字机效果和动态时钟显示是两种非常经典且高频出现的需求。前者常用于角色对话、剧情旁白、任务提示,通过逐字显示模拟真实的打…

2026/7/29 7:01:59 阅读更多 →
从零构建高可靠性红外报警装置:原理、设计与实战避坑指南

从零构建高可靠性红外报警装置:原理、设计与实战避坑指南

1. 项目概述:从“被动防御”到“主动预警”的跨越在安防领域,我们常常面临一个困境:如何在不依赖复杂布线和高昂成本的前提下,实现对特定区域的非接触式、全天候入侵监测?传统的物理屏障或视频监控,要么存在…

2026/7/29 7:01:59 阅读更多 →
AI工具助力毕业论文写作:10大实用工具横评与技巧

AI工具助力毕业论文写作:10大实用工具横评与技巧

1. 毕业论文写作痛点与AI工具崛起写毕业论文是每个大学生都要经历的"渡劫"时刻。从开题报告到格式规范,从文献综述到查重降重,每个环节都让学子们头疼不已。我当年写硕士论文时,光是调整参考文献格式就花了整整三天时间&#xff0c…

2026/7/29 7:00:59 阅读更多 →

日新闻

【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

一、本文介绍 🔥本文在RT-DETR多模态融合目标检测中引入RLAB残差线性注意力模块,可在不同模态特征交互阶段进行多次残差细化,使可见光、红外等特征在尺度、语义和空间位置上更好对齐;随后将细化特征与解码器输出拼接并生成Q、K、V,通过线性注意力自适应强化关键通道、目…

2026/7/29 0:00:23 阅读更多 →
AI编程系列02:合并知识功能,给 AI 问数和 RAG 场景打基础

AI编程系列02:合并知识功能,给 AI 问数和 RAG 场景打基础

AI编程系列02:合并知识功能,给 AI 问数和 RAG 场景打基础 在上一期「AI编程系列」中,我们学习了如何构建一个基础的 AI 问答系统,通过简单的输入输出让模型回应问题。但现实世界中的 AI 应用往往需要处理更复杂的场景:…

2026/7/29 0:00:23 阅读更多 →
AI智能体开发实战:从工具调用到企业级部署

AI智能体开发实战:从工具调用到企业级部署

1. 从被动问答到主动执行:AI Agent的范式转变过去两年,大语言模型最显著的应用形态是聊天机器人——用户提问,AI回答。但真正的生产力革命发生在2023年下半年:当AI学会主动调用工具完成任务时,生产力工具的历史被彻底改…

2026/7/29 0:00:23 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/28 12:04:22 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/28 8:29:16 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/28 5:03:42 阅读更多 →

月新闻