在数字化转型浪潮下,某算法技术企业选择与智曲信息及中科曙光合作,共同推进大模型训练平台建设。依托中科曙光领先的人工智能基础设施产品技术与智曲信息专业的集成服务能力,项目实现了高质量按期交付。
项目背景
在垂直行业大模型竞赛中,训练基础设施的效率直接决定了产品迭代速度。某算法技术企业原有的分布式训练集群建成时间较早,面对新一代MoE架构模型的长周期训练需求,扩容与升级势在必行,为此启动了大模型训练平台建设项目。
需求与挑战
项目需要重点解决三大问题:一是训练线性度,千卡并行场景下加速比不能明显衰减;二是数据供给,海量训练语料的清洗、存储与高带宽读取不能成为瓶颈;三是混部调度,训练、评估与数据处理任务需要灵活编排,避免昂贵的加速卡资源闲置。
解决方案
依托在高端计算领域二十余年的技术积淀,中科曙光为本项目提供了以曙光I620-G30 GPU服务器为核心的大规模智算集群。单节点高密度加速卡配置结合高速无阻塞网络,实现大规模训练任务的线性扩展;存储侧配置ParaStor分布式全闪存储,为海量训练数据提供高吞吐、低时延的数据供给。
软件层面部署曙光DAS人工智能基础软件栈,兼容主流深度学习框架,配合智能调度平台实现千卡级资源的秒级调度与能效管理。智曲信息作为集成交付方,完成了集群部署、性能调优与故障自愈机制建设,并提供全生命周期运维保障服务。
对于人工智能平台建设方而言,能否把算力高效转化为生产力才是成败关键。项目通过标准化的算力服务目录与敏捷的资源交付流程,让客户从“拥有算力”走向“用好算力”,切实降低了业务团队的智能化应用门槛。
实施过程
项目实施期间,智曲信息派出驻场工程师全程跟进,从设备上架、布线规范到系统部署逐项落实标准化作业;同步开展知识转移,为客户运维团队提供系统管理与故障处置培训,确保平台交付后客户具备自主运营能力。
项目成效
平台上线以来,多项关键指标较原有环境显著改善:
- 千卡并行训练线性度保持在88%以上,大规模作业稳定性大幅增强
- 月度模型迭代次数由40次提升至18次,研发节奏明显加快
- 故障自动隔离与任务恢复机制上线后,有效训练时长占比达41%
- 语料清洗流水线吞吐提升5倍,数据供给不再拖训练后腿
回顾项目建设历程,智曲信息始终坚持“以客户为中心”的交付理念,从需求调研阶段的深入业务访谈,到方案设计阶段的多轮专家评审,再到实施阶段的精细化质量管理,每一个环节都力求精益求精。项目验收后,智曲信息还为客户建立了专属服务档案,定期开展系统巡检与健康度评估,让算力基础设施持续保持最佳运行状态。
该项目的成功落地,是智曲信息与中科曙光生态协同的又一次成功实践。未来,智曲信息将继续携手中科曙光,把经过验证的行业解决方案推广至更多客户,以专业服务与可靠产品助力千行百业迈入智能化时代。
