智曲信息与浪潮信息共建某科技股份公司大模型训练平台

 人工智能     |      2026-05-11 15:48:19

历时4个月的建设周期,智曲信息携手浪潮信息为某科技股份公司打造的大模型训练平台正式上线。项目团队克服了工期紧张、场景复杂等多重挑战,一次性通过客户验收,各项性能指标全面达成设计目标。

项目背景

某科技股份公司专注于行业大模型的自主研发,其面向金融、能源等领域的垂直大模型已在多个客户场景落地。随着模型参数规模从百亿迈向千亿,原有训练集群在算力密度、互联带宽和稳定性方面均已接近极限,亟需建设新一代大模型训练平台。

需求与挑战

千亿参数模型训练动辄持续数周,任何一次硬件故障或任务中断都可能造成巨大损失。客户要求新平台在提供充足算力的同时,实现多机多卡高速互联、检查点快速保存与恢复、故障节点自动隔离等能力,把有效训练时长占比做到极致。

解决方案

作为全球领先的服务器厂商,浪潮信息为本项目提供了以NF5688M6 AI服务器为核心的智算集群方案。NF5688M6在4U空间内支持8张高性能AI加速卡,通过全互联架构提供澎湃训练算力;针对推理场景,平台同步引入元脑R1推理服务器,单机可部署16张标准PCIe双宽卡,兼顾大模型推理的吞吐与成本。整机全面导入冷板式液冷散热,配合智算中心级机柜设计,实现高密度部署下的长期稳定运行。

在软件层面,方案部署了AIStation智算管理平台,实现算力资源统一纳管、多租户隔离与作业智能调度,训练任务提交效率大幅提升。智曲信息作为项目总集成方,完成了从机房勘察、方案设计、设备部署到集群调优的全流程交付,并组建专属运维团队提供7×24小时保障服务。

从产业趋势看,算力基础设施正从“堆硬件”走向“系统级创新”。本项目的价值不仅在于交付了一套高性能算力平台,更在于建立了算力、算法、数据协同的一体化运营体系,为客户在人工智能时代的持续创新奠定了坚实基础。

实施过程

为保障项目高质量交付,智曲信息建立了每周例会与里程碑评审机制,与浪潮信息技术团队、客户信息化部门紧密协同,先后完成了设备选型适配验证、系统集成联调、数据迁移演练与应急预案演练,项目全程零安全事故、按期交付。

项目成效

新平台投运后,客户的模型研发效率实现了跨越式提升:

  • 千亿参数模型训练任务线性加速比达到85%,集群满载运行51天无重大故障
  • 单轮训练周期由24天压缩至16天,模型迭代效率提升41%
  • 检查点保存与恢复耗时下降56%,异常中断损失基本清零
  • 训练数据读取带宽提升4倍,数据预处理与训练实现全流水线重叠

作为一家专注于智能算力基础设施与行业数字化解决方案的服务商,智曲信息将以本项目为新起点,持续深化与浪潮信息等全球领先厂商的合作,为客户创造长期价值,共同书写智能化转型的行业答卷。