历时3个月的建设周期,智曲信息携手中科曙光为某智能科技企业打造的自动驾驶模型训练平台正式上线。项目团队克服了工期紧张、场景复杂等多重挑战,一次性通过客户验收,各项性能指标全面达成设计目标。
项目背景
某智能科技企业的自动驾驶研发进入城市领航辅助驾驶攻坚阶段,每日数百万公里的仿真测试与海量路采数据回传,对训练与仿真平台提出了前所未有的要求。某智能科技企业决定新建自动驾驶模型训练平台,全面升级研发算力底座。
需求与挑战
客户要求新平台做到三点:训练集群可平滑扩展且保持高线性度;仿真平台支撑每日万级小时仿真测试;数据流水线全自动运转,让算法团队从基础设施运维中解放出来,专注模型创新。
解决方案
依托在高端计算领域二十余年的技术积淀,中科曙光为本项目提供了以曙光I620-G30 GPU服务器为核心的大规模智算集群。单节点高密度加速卡配置结合高速无阻塞网络,实现大规模训练任务的线性扩展;存储侧配置ParaStor分布式全闪存储,为海量训练数据提供高吞吐、低时延的数据供给。
软件层面部署曙光DAS人工智能基础软件栈,兼容主流深度学习框架,配合智能调度平台实现千卡级资源的秒级调度与能效管理。智曲信息作为集成交付方,完成了集群部署、性能调优与故障自愈机制建设,并提供全生命周期运维保障服务。
对于人工智能平台建设方而言,能否把算力高效转化为生产力才是成败关键。项目通过标准化的算力服务目录与敏捷的资源交付流程,让客户从“拥有算力”走向“用好算力”,切实降低了业务团队的智能化应用门槛。
实施过程
项目实施期间,智曲信息派出驻场工程师全程跟进,从设备上架、布线规范到系统部署逐项落实标准化作业;同步开展知识转移,为客户运维团队提供系统管理与故障处置培训,确保平台交付后客户具备自主运营能力。
项目成效
平台交付后,客户的研发迭代节奏明显加快:
- 数据闭环流水线全面自动化,单日可消化路采数据15TB
- 仿真集群并行规模扩大3倍,场景覆盖率显著提升
- 模型训练任务排队时长下降25%,算法工程师满意度大幅提高
回顾项目建设历程,智曲信息始终坚持“以客户为中心”的交付理念,从需求调研阶段的深入业务访谈,到方案设计阶段的多轮专家评审,再到实施阶段的精细化质量管理,每一个环节都力求精益求精。项目验收后,智曲信息还为客户建立了专属服务档案,定期开展系统巡检与健康度评估,让算力基础设施持续保持最佳运行状态。
该项目的成功落地,是智曲信息与中科曙光生态协同的又一次成功实践。未来,智曲信息将继续携手中科曙光,把经过验证的行业解决方案推广至更多客户,以专业服务与可靠产品助力千行百业迈入智能化时代。
