OLE777

中文 English
全球首发 | SLAI基于国产算力集群完成DeepSeek-V4-Pro全参数后训练
2026.05.28

泉源:深圳河套学院

导读

当今人工智能时代,,,,,,基于国产算力的大模子高效训练和推理是国家生长战略的大问题 。 。 。 。。DeepSeek-V4-Pro在效率和性能方面是业界大模子的优异代表 。 。 。 。。DeepSeek-V4-Pro已经乐成完成在国产算力上推理安排,,,,,,但训练还未完全实现国产算力化 。 。 。 。。

在此配景下,,,,,,深圳河套学院Al训练平台项目团队,,,,,,团结哈尔滨工业大学(深圳)、深圳市大数据研究院、华为GTS(全球手艺效劳)、盘算产品线、2012实验室,,,,,,协同深智城AI算力平台,,,,,,面向国产算力大模子训练开展团结攻关 。 。 。 。。现在,,,,,,仅用1个月时间,,,,,,项目已基于昇腾910C国产算力集群实现DeepSeek-V4-Pro全参数续训练/SFT稳固运行,,,,,,完生长稳训练1500+步,,,,,,训练MFU超30%,,,,,,要害逊с子效率提升14% 。 。 。 。。

据果真资料检索,,,,,,本事情是果真可查规模内,,,,,,业界首个由第三方机构基于国产算力集群完成的DeepSeek-V4-Pro全参数后训练工程实践,,,,,,标记着国产AI基础设施正在从推理安排和轻量化微调迈向超大模子全参数后训练 。 。 。 。。

01

为什么万亿级模子的“全参数后训练”是一块硬骨头??????

DeepSeek-V4-Pro,,,,,,一款1.6万亿参数级MoE开源旗舰模子,,,,,,接纳了CSA+HCA混淆希罕注重力、mHC毗连等新机制 。 。 。 。。相比于上一代DeepSeek-V3/R1,,,,,,它对国产训练框架提出了全方位的“极限挑战” 。 。 。 。。


希罕MoE结构:专家路由带来的跨节点通讯,,,,,,是古板麋集模子的数十倍;;; ; ; ;;



混淆希罕注重力:注重力模式的动态切换,,,,,,对算子效率和显存治理极为敏感;;; ; ; ;;



万亿参数级状态:权重、梯度、激活、优化器状态——仅单副本就需数TB显存 。 。 。 。。

02

焦点希望:千卡集群上,,,,,,1500+步稳固奔驰

经由团结攻关,,,,,,项目已基于千卡级昇腾 910C 国产算力集群,,,,,,乐成实现DeepSeek-V4-Pro在国产算力集群上的全参数后训练稳固运行 。 。 。 。。



长稳SFT训练:完成1500+步迭代,,,,,,skipped iterations = 0,,,,,,NaN iterations = 0;;; ; ; ;;




训练效率:MFU(模子算力使用率)抵达约30%,,,,,,要害逊с子盘算效率较初始版本提升约14%;;; ; ; ;;



最终体现:在昇腾超节点上,,,,,,MFU稳固在34.9% 。 。 。 。。

与此同时,,,,,,DeepSeek-V4-Flash的全参数续训练与SFT链路也已同步买通 。 。 。 。。


OLE777官方网站 - 豪利OLE(中国)DeepSeek-V4-Pro@昇腾超节点训练,,,,,,MFU最终稳固在34.9%


一组数据足以说明差别:在一律参数目下,,,,,,业界果真的国产算力全参数后训练案例险些为零 。 。 。 。。而我们将一个1.6T MoE模子,,,,,,在千卡集群上以27秒/步的稳固节奏,,,,,,一连奔驰1500余步——这不是实验室的“单次演示”,,,,,,而是可复现、可工程化交付的稳固能力 。 。 。 。。

更主要的是,,,,,,该平台已快速验证了笔直领域价值 。 。 。 。。团队围绕工业级自动化运筹建模场景,,,,,,在数周内完成了从数据生产、样本筛选、训练链路买通到效果评测的闭环验证 。 。 。 。。这意味着:国产算力平台不但能够“训大模子”,,,,,,更能“训好行业模子”——以短周期、低本钱构建面向专业使命的增强能力 。 。 。 。。

03

三大概害手艺突破:从“能跑”到“能训、训稳、训优”

本次攻关面向DeepSeek-V4-Pro全参数后训练,,,,,,而非LoRA等少量参数微调 。 。 。 。。团结团队在以下三个层面实现了系统性突破:


1. 漫衍式承载:1.6T参数的“显存拼图”

洞察: 万亿参数不可只靠显存大,,,,,,更要靠“放得巧” 。 。 。 。。

项目乐成构建了权重、梯度、激活、优化器状态的漫衍式承载计划,,,,,,使得数据并行、张量并行、流水并行与专家并行四者协同事情 。 。 。 。。每一张卡上,,,,,,该放什么、怎么放、怎样动态调理——这套“显存拼图”是稳固训练的地基 。 。 。 。。

2. 希罕与通讯:让专家不“吵架”,,,,,,让注重力不“堵车”

洞察: MoE模子训练最怕“专家负载失衡”和“跨节点通讯风暴” 。 。 。 。。

团队针对混淆希罕注重力、MoE路由、归一化、矩阵盘算等要害逊с子举行了深度适配与优化,,,,,,算子效率较初始版本提升14% 。 。 。 。。同时建设了专家负载的实时监控与平衡机制,,,,,,阻止部分专家过载而部分专家闲置 。 。 。 。。

3. 长稳监控:当训练跑上几天几夜,,,,,,谁来守夜??????

洞察: 全参数后训练最恐怖的不是慢,,,,,,而是“跑着跑着就崩了” 。 。 。 。。

团结团队搭建了一套完整的监控系统:Loss曲线、梯度范数、专家负载、显存占用、异常自动恢复……所有指标均可视、可告警、可自愈 。 。 。 。。在1500+步的训练中,,,,,,未泛起一次Loss失控或NaN值——这是“长稳能力”最直接的证实 。 。 。 。。


04

实战验证:数学建模能力在后训练中显著跃升

为了磨练DeepSeek-V4在昇腾集群上举行全参数后训练的真实价值,,,,,,项目设计了一项“硬核”实验:增强盛模子的数学建模能力 。 。 。 。。

团队搭建了一条SFT建模数据生产workflow,,,,,,产出3000条高质量数学建模使命SFT样本,,,,,,笼罩4类目的使命和3种问题形态 。 。 。 。。随后,,,,,,对DeepSeek-V4举行后训练 。 。 。 。。

OLE777官方网站 - 豪利OLE(中国)优化建模SFT数据飞轮流程


训练曲线给出了清晰的信号:



LM loss从高位快速下降,,,,,,最终收敛至0.2056;;; ; ; ;;




MTP-1 loss收敛至0.2538;;; ; ; ;;




梯度范数平稳下降,,,,,,未泛起震荡或发散;;; ; ; ;;



单步耗时稳固在27秒左右 。 。 。 。。

训练曲线给出了清晰的信号:



LM loss从高位快速下降,,,,,,最终收敛至0.2056;;; ; ; ;;




MTP-1 loss收敛至0.2538;;; ; ; ;;




梯度范数平稳下降,,,,,,未泛起震荡或发散;;; ; ; ;;



单步耗时稳固在27秒左右 。 。 。 。。

OLE777官方网站 - 豪利OLE(中国)

3K SFT训练历程概览


更直观的效果来自Benchmark比照:OLE777官方网站 - 豪利OLE(中国)

四项要害指标均显著逾越原模子,,,,,,其中ORGEval WL提升凌驾5个百分点 。 。 。 。。这意味着:在国产算力上完成的全参数后训练,,,,,,不但能“跑稳”,,,,,,更能“训强”——模子在重大推理使命上的能力获得了真实增益 。 。 。 。。

05

以战育才:在真实攻关中作育“能训大模子”的人

本次攻关的另一个奇异价值,,,,,,在于它是一次人才作育模式的范式实验 。 。 。 。。

深圳河套学院将万亿级模子训练攻关作为“练兵场”,,,,,,把学生直接嵌入国产算力真实训练场景 。 。 。 。。阻止现在,,,,,,项目已作育学生42名,,,,,,形成了由青年西席指导、博士生焦点攻坚、工程团队支持的协同作育机制 。 。 。 。。

在这一历程中,,,,,,同砚们不但是加入项目希望,,,,,,更是肩负详细使命的“战斗员”:有的认真训练数据结构与样实质量剖析,,,,,,有的认真漫衍式并行战略验证,,,,,,有的跟进长稳监控与异常;; ; ; ;;指矗,,,,有的撰写手艺报告与工程文档 。 。 。 。。

一次训练启动、一次报错定位、一次参数调解、一次效果复盘——在这些真实而噜苏的工程实践中,,,,,,学生们从“会挪用大模子”真正走向了“明确并加入训练大模子” 。 。 。 。。

能力提升体现在三个方面:



建设了对国产算力大模子训练全链路的系统性熟悉;;; ; ; ;;




掌握了从领域数据到模子能力增强的全历程实操能力;;; ; ; ;;



在真实项目中形成了问题拆解、实验设计、训练复盘与团队协作的工程素养 。 。 。 。。

后续,,,,,,这些真实使命将沉淀为课程案例、实训资源和学生科研项目,,,,,,将一连支持深圳河套学院作育“懂模子、懂系统、能工程、敢攻关”的高水平复合型AI人才 。 。 。 。。

06

未来展望:从“全参数后训练”走向“Agentic RL + 超长上下文”

下一阶段,,,,,,深圳河套学院将继续团结哈尔滨工业大学(深圳)、深圳市大数据研究院、华为GTS(全球手艺效劳)、盘算产品线、2012实验室、深智城等相助同伴,,,,,,在现有全参数续训练/SFT链路基础上,,,,,,重点推进三项使命:


1. 训练效率再突破

一连优化训练框架与要害算子,,,,,,进一步提升训练效率(MFU),,,,,,降低万亿模子训练的算力本钱 。 。 。 。。

2. 超长上下文训练

支持512K至1M超长上下文训练,,,,,,提升重大专业使命中的长文档明确与长链路推理能力;;; ; ; ;;

3. 强化学习后训练闭环

突破DeepSeek-V4-Pro强化学习后训练手艺,,,,,,围绕数学建模优化、代码Agent、长上下文推理等使命,,,,,,构建rollout天生 → 工具执行 → reward/verifier → 战略更新 → 评测反响的完整Agentic RL链路 。 。 。 。。


同时,,,,,,项目将坚定推进手艺开源与人才作育沉淀:


分阶段开放训练设置、评测剧本、合成数据、手艺报告及相关模子与框架能力;;; ; ; ;;



将真实训练使命、数据结构要领、故障排查案例和评测流程转化为课程案例与实训使命;;; ; ; ;;



一连完善“国产算力支持、真实使命牵引、学生团队实战、工程能力沉淀”的作育路径 。 。 。 。。

在此基础上,,,,,,项目还将依托这一训练 。 。 。 。。,,,,开展新一代通用人工智能的基础理论、新范式和新架构的研究——包括符号、毗连与行为主义有机融合,,,,,,从简单智能体到群体智能再到人机融合的建模探索 。 。 。 。。

结语

DeepSeek-V4-Pro在国产算力上的全参数后训练,,,,,,不是一次伶仃的工程突破 。 。 。 。。

它验证了一条蹊径:国产开源旗舰模子 + 国产AI算力 + 高水平训练团队 + 国产厂商手艺支持——这个四角闭环,,,,,,是可一连的、可复制的、可信托的 。 。 。 。。

它发出了一声宣告:国产AI基础设施,,,,,,从今天起,,,,,,不再只是“能推理”,,,,,,而是真正“能训练、能训稳、能训优” 。 。 。 。。

更主要的是,,,,,,它点燃了一个希望:在下一代通用人工智能的征途上,,,,,,中国的高校、科研机构和年轻学子,,,,,,可以站在自己的算力土壤上,,,,,,开展人工智能的研究,,,,,,亲手训练属于自己的万亿模子 。 。 。 。。

这不是终点,,,,,,而是发令枪 。 。 。 。。

?项目后续将逐步开源手艺报告、训练设置与评测剧本,,,,,,敬请关注深圳河套学院官方宣布 。 。 。 。。






版权声明:本文转载自深圳河套学院官方公众号,,,,,,仅用于行业资讯交流与手艺分享,,,,,,不代表本公司立 。 。 。 。。,,,,不必于任何商业用途 。 。 。 。。版权归原作者及原出地方有,,,,,,若有侵权,,,,,,请联系OLE777实时删除 。 。 。 。。


OLE777官方网站 - 豪利OLE(中国)

OLE777官方网站 - 豪利OLE(中国)
在线咨询

4008-770-775

OLE777官方网站 - 豪利OLE(中国)
电话咨询
OLE777官方网站 - 豪利OLE(中国) TOP
【网站地图】【sitemap】