分论坛:大模型的高效训练与推理

会程安排

2026年8月5日 下午
402会议室

主席

包世龙
助理研究员 ⋅ 中国科学院计算技术研究所
包世龙,中国科学院计算技术研究所助理研究员,主要从事机器学习与人工智能安全研究,重点包括复杂学习场景下的排序优化、安全可靠的多模态生成等,在 CCF-A 类期刊/会议上发表论文 25+篇,包括TPAMI 9 篇 (IF:20.4)。先后入选中国博士后科学基金国家资助博士后研究人员计划、北京市“高创计划”青年人才托举工程、中国科学院优秀博士学位论文奖、中国科学院特别研究助理项目等人才支持计划;主持国家自然科学基金青年项目(C类)、中国博士后科学基金特别资助、中国博士后科学基金面上等项目,并参与中科院先导 B、国家自然科学基金专项等重大项目。
王伟
教授 ⋅ 北京交通大学
王伟,北京交通大学教授、博士生导师,国家级青年人才计划入选者,现任信息科学研究所副所长。本科毕业于西北工业大学,获南丹麦大学硕士及意大利特伦托大学博士学位,并曾在新加坡国立大学访学、瑞士洛桑联邦理工大学从事博士后研究,之后任意大利特伦托大学助理教授。长期聚焦计算机视觉、机器学习与生成式人工智能,在生成式模型与Transformer架构设计方面开展了系统性工作,涵盖潜在空间编辑、模型轻量化与高效注意力机制等核心技术。他在CVPR、ICCV、NeurIPS、ICML等顶级会议及TPAMI、TIP等权威期刊发表论文近50篇,主持国家自然科学基金、北京市自然科学基金等重点项目,并深度参与了欧盟地平线及瑞士创新署重大研究计划。 凭借系列创新成果,荣获ACM MM最佳论文提名奖及意大利计算机视觉与机器学习协会最佳博士论文奖。王伟教授现任NeurIPS领域主席、AAAI高级程序委员,并当选IEEE高级会员。
许倩倩
研究员 ⋅ 中国科学院计算技术研究所
许倩倩,中国科学院计算技术研究所研究员,博士生导师。研究方向为机器学习、跨媒体计算、知识图谱。主持国家自然科学基金青年科学基金A类、B类、联合基金重点、北京智源学者、中国科学院先导课题等项目10余项。发表CCF-A类论文100余篇(包括TPAMI 20余篇),获2024年ACM MM Honourable Mention Award,并获NeurIPS/CVPR等CCF-A类国际会议竞赛冠军15项。担任国际期刊TMM、TCSVT、ACM TOMM和Multimedia Systems编委,10余次担任CCF-A类国际会议领域主席。现/曾任CSIG青工委副秘书长、CSIG多媒体专委会副秘书长、CCF多媒体技术专委会副秘书长、CAAI深度学习专委会副秘书长。曾获中国图像图形学会自然科学一等奖(第一完成人)、吴文俊人工智能自然科学一等奖(第三完成人)、吴文俊人工智能科技进步二等奖、浙江省技术发明二等奖、茅以升北京青年科技奖、中国图像图形学会石青云女科学家奖、吴文俊人工智能优秀青年奖、中国人工智能学会最佳青年科技成果奖、ACM中国SIGMM新星,并入选首份AI华人女性青年学者榜单。研究成果成功应用于国家安全部门、阿里巴巴、百度等。

分论坛报告

智能座舱的多模态具身交互
马楠 教授 ⋅ 北京工业大学
报告摘要:针对智能汽车发展过程中智能座舱数据结构较为单一,座舱与用户交互模块间关联性有待增强,多模态感知信息获取质量及利用效率尚需提升等问题,团队近年来聚焦基于智能座舱交互多模态数据的用户行为分析与评价方法,包括研究视听触多模态数据智能获取与编码融合方法,实现座舱内嘈杂、遮挡等场景中跨源信息间的配准融合,力求提升智能座舱用户行为感知数据的处理能力;研究基于常规行为字典与开放式行为增量的用户行为交互模型,结合用户行为交互数据以在线的方式微调大语言模型,以离线的方式构造行为字典,实现多模态用户交互行为序列分割与典型交互模式识别,并研究基于对用户微表情、声音、动作的多模态状态感知和建模评价,力求推动智能座舱智能化水平迭代发展。
讲者简介:马楠,北京工业大学教授、博士生导师,人工智能学院院长,国家级高层次领军人才,国家重点研发计划项目首席科学家,具身交互智能北京市重点实验室主任,中国人工智能学会会士、副秘书长,北京市先进工作者,北京市朝阳区“凤凰计划”领军人才。研究方向为交互认知、具身智能、无人驾驶和智能机器人。第一完成人获得中国图像图形学会科技进步一等奖等科技奖项;主持国家、省部级项目10余项;承担北汽、东风等企业委托课题10余项;获得国内外人工智能、无人驾驶赛事冠军20余项;已在IEEE TPAMI、TRO、TIP、Engineering、中国科学•信息科学、AAAI和ICRA等国内外权威期刊和会议发表论文百余篇;先后获得第六届全国教育科学研究优秀成果奖二等奖、北京市教学成果一等奖和北京工业大学教育教学成果特等奖等。
面向高效推理的草稿自拟投机解码方法
车万翔 教授 ⋅ 哈尔滨工业大学
报告摘要:随着大语言模型在各类应用中广泛部署,其解码效率成为制约端侧推理的重要瓶颈。主流模型依赖自回归逐Token生成,既受限于访存比低的硬件环境,又难以实现并行加速。投机解码作为新兴方向,利用小模型生成草稿并由大模型并行验证,已展现出显著的加速潜力。然而,现有方法普遍依赖额外草稿模型,带来显存占用高、兼容性差等问题。为此,我们提出“草稿自拟”的投机解码思路:通过加噪训练(MSN)赋予大模型自身并行解码能力,无需外部草稿模型即可实现2.28–2.68倍加速;同时提出即插即用的Token Recycling机制,仅需不足2MB存储即可实现约2倍无损加速。该方案在保证生成质量的前提下,有效缓解资源压力,具备更强通用性与端侧适配性,为大模型高效推理提供了新的解决路径。
讲者简介:车万翔,哈尔滨工业大学计算学部长聘教授,人工智能研究院副院长,国家级青年人才,斯坦福大学访问学者。主要研究方向为自然语言处理与大语言模型。现任中国中文信息学会计算语言学专委会副主任兼秘书长,国际顶级会议ACL 2025程序委员会共同主席。承担国家自然科学基金重点等项目,著有《自然语言处理:基于大语言模型的方法》等。主导研发的语言技术平台(LTP)已被百度、腾讯、华为等企业付费使用。曾获2024年吴文俊人工智能科技进步一等奖(排名第1)、黑龙江省科技进步一等奖(排名第2)及AAAI最佳论文提名、2025 年IEEE信号处理学会最佳论文奖等,并入选“全球前2%顶尖科学家”榜单。
核心上下文感知Transformer:长上下文高效建模与推理
谭明奎 教授 ⋅ 华南理工大学
报告摘要:大模型上下文窗口已扩展至百万级,但传统自注意力机制存在计算开销激增、上下文遗忘、注意力分散等瓶颈,长序列冗余机理也缺乏系统理论支撑。本报告从理论层面揭示Transformer长序列建模的“维数灾难”本质,证明注意力权重的稀疏性规律;提出核心上下文感知(CCA)注意力机制,通过全局语义压缩与局部细粒度保留的互补架构,可即插即用替换现有注意力模块,在128K场景下实现7.9倍推理加速、93% KV显存降低,长文本理解精度优于同类方法。针对免训练落地需求,进一步提出动态稀疏感知方案,自适应筛选核心上下文,实现预填充与解码双阶段加速,128K场景下推理提速2.8倍、KV缓存缩减61%,通用任务性能与全注意力机制基本持平。最后展望长上下文大模型的后续研究与产业落地方向。
讲者简介:谭明奎,华南理工大学教授、博导,TPAMI及MIR编委,“大数据与智能机器人”教育部重点实验室副主任,专注机器学习与大模型、视觉信息处理等方向研究,以一作/通讯作者发表学术论文180余篇、谷歌引用超2.3万次。牵头获吴文俊自然科学一等奖、教育部自然科学二等奖,广东省青年科技创新奖,世界华人数学家联盟“最佳论文奖”、广东省人工智能产业协会自然科学奖一等奖等。担任人工智能权威会议NeurIPS、ICML、ICCV,CVPR、AAAI等会议领域主席。
Lion优化器的收敛分析与改进
张利军 教授 ⋅ 南京大学
报告摘要:近年来,基于梯度符号的随机优化算法受到广泛关注,并在大模型训练等实践场景中取得了显著成功。然而,其理论研究仍明显滞后于实践发展:已有分析通常依赖较强的假设条件,或仅能建立次优的收敛速率。围绕这一问题,我们在近期工作中研究了该方向的代表性算法Lion,分别刻画了其在单机和分布式优化场景下的收敛速率;此外,我们进一步引入方差约减技术,从理论上改进了Lion的收敛性能。
讲者简介:张利军,南京大学人工智能学院教授,基金委优青。主要研究大规模机器学习与优化,发表CCF-A类期刊和会议论文120余篇,论文共被引用近8000次。目前担任机器学习权威期刊《Machine Learning》副主编,10余次担任机器学习顶级会议ICML/NeurIPS/ICLR领域主席。主持基金委联合重点项目、国际合作项目等。曾获首届达摩院青橙奖、CCF-A类会议论文奖等荣誉。
大模型压缩与推理加速
张淼 教授 ⋅ 哈尔滨工业大学(深圳)
报告摘要:随着大模型技术的快速发展,模型规模和计算开销持续增长,如何在保证模型能力的同时降低部署成本、提升推理效率,已成为大模型落地应用中的关键问题。大模型压缩与推理加速旨在通过量化、稀疏、高效注意力、KV Cache 优化等技术,减少模型参数量、显存占用和计算延迟,从而提升大模型在云端、边缘端和端侧设备上的部署可行性。本报告将围绕大模型压缩与推理加速的典型方法展开介绍,重点分析低比特量化、激活稀疏、Token 剪枝、KV Cache压缩等方向的基本思想与团队相关近期工作。
讲者简介:张淼,哈尔滨工业大学(深圳)教授,博士生导师,国家级青年人才,河套学院客座教授,计算机科学与技术学院院长助理。曾就职于丹麦奥尔堡大学计算机学院助理教授,澳大利亚莫纳什大学研究员,博士毕业于澳大利亚悉尼科技大学。主要从事端侧人工智能和高效机器学习方向,涉及领域包括大模型压缩与推理加速,高效模型架构设计、高效多智能体系统等。一作/通讯发表CCF A类会议或期刊论文40余篇,如IEEE TPAMI,ICML,NeurIPS,CVPR等。目前担任IEEE TCSVT Associate Editor,ACL AE,IJCAI SPC等,主持6项国家级和省部级项目和课题。在产业应用与成果转化方面,相关研究成果已在大模型推理优化与多智能体系统等方向与多家头部企业开展合作。