
上证报中国证券网讯据中国信通院7月20日消息,随着大模型参数规模与训练数据量持续增长,千卡乃至万卡规模GPU集群已成为大型模型训练的普遍选择,算力基础设施建设加速推进。然而,集群实际算力效率与理论峰值之间仍存在显著差距——模型算力利用率、显存利用率、线性扩展效率等关键指标受开销、流水线气泡、显存瓶颈等多重因素制约,不同技术方案的工程能力差异可达数倍。当前,业界对大规模集群性能的衡量口径尚未统一,指标定义、测量方法与数据可比性存在明显不足,难以有效支撑算力建设方的选型决策与模型训练方的性能优化。
为破解上述产业共性问题,中国信息研究院(简称“中国信通院”)依托人工智能软硬件协同创新与适配验证中心(位于北京经开区国家信创园),基于AISHPerf软硬件基准体系,正式启动“AISHPerf大模型训推工程实践性能基准研究工作”。
该项工作以“建基准、聚数据、促优化”为核心方向,聚焦千卡至万卡规模集群在训练与推理环节的核心性能瓶颈,系统梳理模型算力利用率、显存利用率、线性扩展效率、有效训练时间占比、首词元时延、吞吐量、显存带宽利用率等关键指标的定义口径与经验值区间,结合业界公开技术报告与实测数据,为行业提供可引用、可对标、可追溯的工程性能参考基准,推动可信智算体系规范化发展。
一是完善指标体系。建立统一的性能指标定义、测量方法与报告规范,明确各指标适用场景与计算口径,消除因定义不一致导致的横向比较偏差。
二是汇聚行业数据。广泛征集模型训练方、芯片厂商与算力建设方的实测性能数据,形成脱敏化的行业基准参考区间并定期动态更新,为产业各方提供对标依据。
三是推动工程实践。梳理业界在优化、显存管理、并行策略调度等方面的成熟经验,形成可复用的优化路径建议,助力算力建设方科学选型、模型训练方精准调优。
此次“AISHPerf大模型训练与推理工程实践性能基准研究工作”将充分发挥在算力评测与基准研制方面的研究基础与行业经验,推动我国大规模智算集群工程性能评估体系规范化升级。