分论坛:国产大模型的部署与优化

会程安排

2026年8月5日 下午
309会议室

主席

杨智勇
副教授 ⋅ 中国科学院大学
中国科学院大学副教授,博士生导师,研究方向聚焦可信、高效机器学习,在CCF-A类期刊及会议共发表论文70余篇,其中TPAMI 20余篇(一作 6篇),ICML/NeurIPS 20余篇(spotlight/oral 8篇),担任ICML/NeurIPS/ICLR 领域主席,JCR一区期刊Information Fusion/Pattern Recognition/Neural Networks编委,获吴文俊青年科技奖、CCF优秀博士学位论文激励计划 (原CCF优博)、中国图像图形学会自然科学奖一等奖、吴文俊科技进步二等奖小米学者、首届百度AI全球华人新星百强、首届亚洲可信机器学习奖励金6项CCF-A类会议国际竞赛冠军。
冯骁骋
教授 ⋅ 哈尔滨工业大学
冯骁骋,哈尔滨工业大学计算学部社会计算与信息检索研究中心教授(入选校青年人才拔尖计划)、博导,国家高层次青年人才。人工智能学院副院长,中文信息处理黑龙江省重点实验室主任助理。 研究兴趣包括自然语言处理、文本生成、机器翻译等。在ACL、AAAI、NeurIPS、TKDE、TOIS等CCF A/B类国际会议及期刊发表论文70余篇。据Google学术统计,论文引用数量超17000次,两篇论文入选Google学术2020年高被引榜单,一篇论文入选Paper Digest EMNLP 2020 Top Ten 高引论文。担任NIPS、ICML、AAAI、IJCAI、ACL等国际会议程序委员会高级/普通成员;兼任鹏城实验室双聘学者、中国图像图形学会青工委委员、中国中文信息学会青年工作委员会副主任、2023-2024中国计算机学会YOCSEF哈尔滨分论坛主席等。 入选中国科协第六届青年人才托举工程,曾获一级学会中国中文信息学会优秀博士学位论文奖、教育部科技创新一等奖、吴文俊人工智能一等奖、黑龙江省科技进步一等奖、二等奖,2023中国计算机学会自然语言处理专委会青年新锐奖和2022年世界人工智能大会(WAIC)-云帆奖。主持国家自然科学青年基金B类(原国家优秀青年基金)、科技创新2030—新一代人工智能重大项目子课题一项、国家实验室重点项目课题一项、国家自然科学基金面上和青年项目各一项;黑龙江省重点研发项目一项、黑龙江省优秀青年基金一项,MSRA Collaborative Research Program;与华为、腾讯、科大讯飞、微软等国际一流互联网公司保持长期科研合作关系。
秦兵
教授 ⋅ 哈尔滨工业大学
秦兵,哈尔滨工业大学长聘教授,社会计算与交互机器人研究中心主任。中国中文信息学会常务理事,中国中文信息学会情感计算专委会主任,科技部科技创新2030-“新一代人工智能”重大项目管理专家组专家。研究方向:自然语言处理及大模型技术等。发表论文近200篇,累计被引3万余次。连续多年入选爱思唯尔高被引学者榜单,入选2020年福布斯中国科技女性榜及2025年全球顶尖2%科学家。获教育部科学研究优秀成果奖工程技术一等奖,黑龙江省科技进步一等奖、CCF科技成果奖科技进步一等奖、钱伟长中文信息处理科学技术奖一等奖等奖项。

分论坛报告

大小模型协同知识推理
刘新旺 教授 ⋅ 国防科技大学
报告摘要:基于既有背景知识、环境信息及历史行为推演出全新的、高价值知识,是搜索推荐、金融风控、医疗诊断以及军事决策等领域的核心能力。随着大型语言模型(Large Language Model,LLM)的快速发展,借助其强大的推理能力从复杂信息中挖掘潜在知识,已成为当前研究的重点。然而,LLM庞大的参数规模导致其在资源受限场景中难以直接部署与应用。针对这一挑战,课题组提出了一套基于大小模型协同的知识推理算法体系,包括面向轻量模型的自适应思考推理、结合跳跃思考与潜层思维链的高效推理机制以及以思维链为引导的结构化知识推理策略等。该系列方法在显著降低计算成本的同时,全面提升了推理的精度与鲁棒性。
讲者简介:刘新旺,国防科技大学计算机学院教授、博导。主要研究方向为机器学习、数据挖掘等。国家杰青(2023)、国家优青(2019)获得者。国家自然科学基金委重点项目、科技创新2030重大项目负责人,基金委创新群体A类核心成员。共发表CCF A类期刊/会议论文150余篇, ESI高被引论文20篇, 谷歌学术引用共2.7万余次, 连续4年入选全球2%顶尖科学奖榜单 (2022-2025)。担任IEEE T-KDE, IEEE T-NNLS, IEEE T-CYB等国际顶刊AE, 以及ICML, NeurIPS等国际顶会领域主席。研究成果获中国计算机学会自然科学一等奖(2025)、中国人工智能学会吴文俊自然科学一等奖(2024)、北京市科技进步一等奖(2024)、湖南省自然科学一等奖 (2014, 2021)、中国图像图形学会自然科学二等奖 (2024, 2025)等。
大模型压缩蒸馏技术在企业级落地的探索与实践
黄龙涛 研究员 ⋅ 阿里巴巴
报告摘要:大模型参数激增带来推理延迟和算力成本高企,成为业务规模化落地的核心障碍。本报告从企业实战出发,系统介绍我们在压缩蒸馏方向上的算法创新与应用实践。针对传统蒸馏在知识迁移中学习难度失配及自回归误差累积问题,我们提出了自适应精细散度度量与状态分布约束新范式,显著提升蒸馏效率与训练收敛速度。在落地应用方面,构建覆盖通用蒸馏到垂直领域适配的全链路生产流水线,产出多个轻量级高效小模型,已在高流量业务中规模化上线,在业务效果持平前提下,大幅节省了推理成本。
讲者简介:黄龙涛,阿里巴巴安全AGI实验室负责人,研究领域涉及安全垂域大模型的构建与应用、大模型安全等。在ACL、AAAI、IJCAI、WWW、SIGIR等人工智能领域顶级会议及期刊发表论文50余篇,Google Scholar累计引用2000余次,曾获得2022年吴文俊人工智能科技进步二等奖、入选第二届中国科协优秀科技论文遴选计划、中科院青促会。
端侧具身智能系统
徐梦炜 副教授 ⋅ 北京邮电大学
报告摘要:具身智能是人工智能下一个十年的重要范式,是抵达AGI的必经之路。具身智能强调智能体在复杂物理环境中的持续感知、理解、决策与行动闭环,为人工智能从信息处理走向真实世界任务执行提供了新的技术路径。随着模型能力的提升及端侧算力平台的持续演进,将具身智能能力部署到终端设备之上,正成为推动人工智能走向实时化、个体化与普适化应用的重要趋势。本报告将围绕端侧具身智能的关键技术展开讨论,重点介绍在端侧环境感知与行为建模、真实交互数据支撑、模型高效部署与推理加速等方面的研究进展。
讲者简介:徐梦炜,北京邮电大学计算机学院副教授,博士生导师。主要研究领域为端侧具身智能算法和系统软件,相关成果发表于MobiCom/ATC/ASPLOS/软件学报等国内外重要会议和期刊,获USENIX ATC 2024最佳论文奖。主持国自然青年基金B/C类、2030重大项目课题等多个项目,入选中国科协青年人才托举工程,北京市科技新星,微软亚洲研究院“铸星计划”访问学者。
面向大模型训练推理的国产软硬件广谱适配
韩旭 助理研究员 ⋅ 面壁智能
报告摘要:规模法则驱动下的大模型训练与推理,离不开大规模分布式算力的高效支撑。相较于英伟达算力生态,国产算力及其配套软件栈呈现出类型多样、接口不统一、特性差异显著等特点,为基于国产算力开展大模型训练与推理带来了诸多挑战。本报告将重点介绍如何构建广谱适配国内主流芯片的大模型训练推理框架,如何结合国产芯片的计算与通信特性开展分布式通信计算协同优化,并展示基于国产软硬件体系训练大模型所取得的效果。
讲者简介:韩旭,清华大学计算机系助理研究员,研究方向为人工智能、自然语言处理、智能计算系统,在国际顶级学术会议及期刊发表论文百余篇,Google Scholar他引1.9万余次,创建大模型开源社区OpenBMB,相关开源项目在全球最大开源社区Github上累计获得数万星标。曾获得教育部自然科学一等奖、世界互联网大会领先科技奖、钱伟长中文信息处理科学技术奖,曾入选中国计算机学会(CCF)优博激励计划、博士后创新人才支持计划、清华大学水木学者计划、清华大学优秀博士后、《麻省理工科技评论》“中国区35岁以下科技创新35人”。
面向视频生成与3D理解重建基座模型的高效优化:量化、稀疏化与缓存加速
杨传广 研究员 ⋅ 中国科学院计算技术研究所
报告摘要:扩散模型与Transformer架构推动了视频生成和3D理解重建的快速发展,但模型规模扩大、时空token序列增长和三维表示复杂化,也带来了显存占用高、推理延迟长和部署成本大的问题。本报告围绕生成式视觉模型的压缩与加速,介绍视频扩散Transformer中的低比特量化、时序蒸馏、微调样本选择、稀疏token优化以及稀疏注意力方法;进一步讨论长视频生成与视频世界模型中的异质token缓存、场景记忆管理和历史KV状态调控机制;最后介绍面向VGGT、SAM3D等3D理解重建基座模型的后训练量化、异质计算分配和几何复杂度自适应加速方法。报告旨在探讨高效生成式视觉智能的发展:从简单地静态压缩模型参数,走向动态的面向时空结构、token重要性、几何异质性与记忆机制的任务感知型高效推理。
讲者简介:杨传广,中国科学院计算所智能算法安全全国重点实验室副研究员、硕导,近期研究方向为视频生成与3D理解重建的高效性问题,目前已在CCF-A类期刊会议上发表论文30余篇,曾获博士后创新人才支持计划、CCF博士学位论文激励计划提名、中国科学院院长特别奖、中国指挥与控制学会科技进步一等奖,现任CAAI青工委委员和CICC具身智能专委会委员。主持国自然青C、中国科学院青年重点项目和腾讯IEG校企合作项目。