泉源:深圳河套学院
深圳河套学院团结智子芯元、昇腾AI、深圳市大数据研究院通过Agent驱动的一体化流水线,,,,,,,实现模子迁徙百倍效率提升、性能精准优化,,,,,,,为国产算力的多行业规模;;;;;;;τ冒聪隆凹铀偌薄。。。。。。。
目今国产算力正进入规模;;;;;;;涞亟锥,,,,,,,面临多行业、多使命的应用场景,,,,,,,一个要害挑战是:
全球前沿模子能否在国产AI芯片上实现快速设置、高效运行???????
在国产算力上,,,,,,,模子迁徙通常需要跨过两道关:
1)让模子快速跑起来:兼容硬件情形、Pytorch模子、国产芯片已有算子等;;;;;;;;
2)让模子跑得更快:定位推理链路中的瓶颈,,,,,,,并举行系统性优化。。。。。。。。
古板流程往往依赖人工履历与重复试错,,,,,,,难以支持多模子版本、一连迭代的交付节奏。。。。。。。。为此,,,,,,,我们将“规模;;;;;;;逝 + 端到端优化”意会为一条可复现、可验证的交付链路,,,,,,,把迁徙从履历驱动的试错历程,,,,,,,转为可复制的工程流程。。。。。。。。现在事情重点面向昇腾平台睁开,,,,,,,同时,,,,,,,焦点流程也已在其他国产芯片平台上完成起源可行性验证。。。。。。。。

从“一次能跑”到“恒久可交付、可提速”
01
简介:
从“适配靠履历”到“交付靠系统”
古板跨平台迁徙往往泛起两类典范痛点:
? 情形碎片化:每个模子维护一套镜像,,,,,,,依赖冲突频发,,,,,,,迁徙全靠手工试错。。。。。。。。
? 性能不可控:纵然“能跑”,,,,,,,端到端吞吐常被预处置惩罚、解码循环、算子选择等因素隐性瓶颈拖慢。。。。。。。。
我们用Agent化的一体化计划把“适配—优化”串成一条链路。。。。。。。。两个计划的对好比下:

02
国产算力上的规模;;;;;;;W邮逝
我们将重大的硬件适配履历固化为可执行的智能体Skill事情流???????椋ㄗⅲ篠Kill事情流指的是让AI学会执行某项详细使命的专门能力或“手艺指南”)。。。。。。。。这套面向AI智能体的“工程指南 + 工具集”,,,,,,,使智能体能够自动识别 NPU 驱动并通过多次试错中的履历,,,,,,,自主完成情形同步使命。。。。。。。。交付效率与笼罩效果如下:
? 小时级极速适配:对一些主流模子,,,,,,,10 分钟内完成从情形设置到推理 Demo 运行;;;;;;;;对绝大大都模子,,,,,,,1 小时内也可完成适配。。。。。。。。
? 500+ 模子笼罩:我们接纳“深度精修”与“规模自动化”团结,,,,,,,完成了对 ChemDFM、ESM2、DINOv3 等科学盘算与前沿视觉标杆模子的深度适配;;;;;;;;别的,,,,,,,依托多智能体协作机制,,,,,,,实现了 500+ 模子的自动适配。。。。。。。。需注重,,,,,,,自动库着重于规模;;;;;;;尚行匝橹,,,,,,,代码质量可能受模子重漂后影响保存波动,,,,,,,后续将团结 CI 机制举行长效自愈。。。。。。。。
以下是部分主流模子的适配时间实测:

03
模子适配后的自动优化提速
在稳固运行模子后,,,,,,,下一个问题是:模子性能怎样进一步提升???????我们开发了一个更周全的智能体工具,,,,,,,可实现自动优化:以端到端视角自动定位性能瓶颈,,,,,,,并通过自界说解码循环、快速预处置惩罚管线等手段,,,,,,,自动天生并应用优化计划,,,,,,,实现性能提升。。。。。。。。
我们较量了起源适配过的模子和自动优化后的模子,,,,,,,在7个代表性模子上完成系统验证:系统响应时间(用P50延迟来权衡)平均降低18.4%,,,,,,,最高降低38.0%;;;;;;;;模子吞吐平均提升 23.3%(最高 64.6%)。。。。。。。。下文是详细的比照:
名词诠释:延迟(latency)指一次请求从提倡到返回效果的端到端耗时;;;;;;;;“P50 延迟”为延迟漫衍的 50% 分位点(中位数),,,,,,,反应典范请求的响应时间。。。。。。。。
推理提速效果比照

注:起源适配后的模子与自动优化后的版本对齐了预热战略、测试数据与参数设置。。。。。。。。
在一些典范案例上,,,,,,,我们找到的自动加速计划和效果如下:
? DINOv3:轻量模子的真实瓶颈常在预处置惩罚。。。。。。。。以自界说快速预处置惩罚管线替换通用 ImageProcessor,,,,,,,使端到端 P50 降低 38.0%,,,,,,,吞吐提升 64.6%。。。。。。。。
? GLM-OCR:通过 NPU ACL 算子级优化与推理路径精简(阻止不须要的 I/O),,,,,,,P50 降低 34.1%。。。。。。。。
? BioGPT / ChemDFM:用自界说贪心解码循环替换通用 generate(),,,,,,,配合 KV Cache 治理与 ACL 高性能算子战略,,,,,,,实现 10%~15% 的端到端加速。。。。。。。。
? GROVER:引入 SDPA 融合注重力并扩展预热笼罩序列长度,,,,,,,消除尾部延迟毛刺,,,,,,,实现 10.5% 的 P50 加速。。。。。。。。
04
开发者行动:
在河套,,,,,,,共筑AI生态未来
现在自动适配工具SLAI-AscendBridge已开源;;;;;;;;自动提速优化工具KernelCAT已开启内测,,,,,,,以申请制形式开放试用,,,,,,,接待开发者、科研机构与工业同伴配合完善国产算力的模子交付与性能工程能力。。。。。。。。
● 开源项目(AscendBridge|自动适配):https://gitcode.com/AI4Science/SLAI-AscendBridge(点击“阅读原文”即可跳转)
沉淀“人 + AI”深度适配履历,,,,,,,聚焦科学盘算与前沿标杆模子的高质量交付。。。。。。。。
https://chongweiliu.github.io/slai-ascend-auto-adapt/dashboard/
实时展示通过多智能体协作实现的 500+ 模子全自动适配效果与运行状态。。。。。。。。
● 性能优化能力(KernelCat|自动提速):目今以内测API形式开放,,,,,,,面向相助同伴提供接入与团结优化支持(接待申请内测)。。。。。。。。
版权声明:本文转载自深圳河套学院官网,,,,,,,仅用于行业资讯交流与手艺分享,,,,,,,不代表本公司态度,,,,,,,不必于商业用途。。。。。。。。版权归原作者及原出地方有,,,,,,,若有侵权,,,,,,,请联系OLE777实时删除。。。。。。。。
上一条抢抓人工智能生长战略机缘期,,,,,,,携手构建网络空间运气配合体2026.03.20
下一条天下首批 | 百信入选数智化转型成熟度及数智化转型使能咨询效劳机构2026.02.12
_1757660066.png)
4008-770-775