近日,由智曲信息携手英特尔共同建设的某软件科技企业大模型训练平台项目顺利交付并投入运行。作为双方在人工智能基础设施领域的深度合作成果,该项目为某软件科技企业构建了坚实的智能算力底座,成为智曲信息“携手一流厂商、服务行业客户”的又一标杆实践。
项目背景
在垂直行业大模型竞赛中,训练基础设施的效率直接决定了产品迭代速度。某软件科技企业原有的分布式训练集群建成时间较早,面对新一代MoE架构模型的长周期训练需求,扩容与升级势在必行,为此启动了大模型训练平台建设项目。
需求与挑战
项目需要重点解决三大问题:一是训练线性度,千卡并行场景下加速比不能明显衰减;二是数据供给,海量训练语料的清洗、存储与高带宽读取不能成为瓶颈;三是混部调度,训练、评估与数据处理任务需要灵活编排,避免昂贵的加速卡资源闲置。
解决方案
项目采用了搭载英特尔至强6性能核处理器的服务器平台。至强6内置AMX高级矩阵扩展指令,无需独立加速卡即可高效执行大模型推理与轻量训练任务;12通道DDR5内存带来充裕的内存带宽,配合丰富的PCIe 5.0扩展能力,为“CPU推理+GPU训练”的混合负载提供了灵活架构。
方案同时引入至强6内置的DSA数据流加速器与QAT加密加速器,将数据搬运与加解密任务从处理器核心卸载,全链路处理效率进一步提升。智曲信息完成了推理框架的AMX指令优化与集群部署,帮助客户以更优的总体拥有成本支撑大模型业务规模化落地。
对于人工智能平台建设方而言,能否把算力高效转化为生产力才是成败关键。项目通过标准化的算力服务目录与敏捷的资源交付流程,让客户从“拥有算力”走向“用好算力”,切实降低了业务团队的智能化应用门槛。
实施过程
为保障项目高质量交付,智曲信息建立了每周例会与里程碑评审机制,与英特尔技术团队、客户信息化部门紧密协同,先后完成了设备选型适配验证、系统集成联调、数据迁移演练与应急预案演练,项目全程零安全事故、按期交付。
项目成效
平台上线以来,多项关键指标较原有环境显著改善:
- 千卡并行训练线性度保持在91%以上,大规模作业稳定性大幅增强
- 月度模型迭代次数由47次提升至17次,研发节奏明显加快
- 故障自动隔离与任务恢复机制上线后,有效训练时长占比达56%
- 语料清洗流水线吞吐提升2倍,数据供给不再拖训练后腿
回顾项目建设历程,智曲信息始终坚持“以客户为中心”的交付理念,从需求调研阶段的深入业务访谈,到方案设计阶段的多轮专家评审,再到实施阶段的精细化质量管理,每一个环节都力求精益求精。项目验收后,智曲信息还为客户建立了专属服务档案,定期开展系统巡检与健康度评估,让算力基础设施持续保持最佳运行状态。
作为一家专注于智能算力基础设施与行业数字化解决方案的服务商,智曲信息将以本项目为新起点,持续深化与英特尔等全球领先厂商的合作,为客户创造长期价值,共同书写智能化转型的行业答卷。
