OLE777

中文 English
SLAI新突破!快速规模;; ;;;;;逝 + 端到端提速
2026.02.14

泉源:深圳河套学院

深圳河套学院团结智子芯元、昇腾AI、深圳市大数据研究院通过Agent驱动的一体化流水线,,,,,,,实现模子迁徙百倍效率提升、性能精准优化,,,,,,,为国产算力的多行业规模;; ;;;;;τ冒聪隆凹铀偌薄 。。。。。。。

目今国产算力正进入规模;; ;;;;;涞亟锥,,,,,,,面临多行业、多使命的应用场景,,,,,,,一个要害挑战是:

全球前沿模子能否在国产AI芯片上实现快速设置、高效运行???????

在国产算力上,,,,,,,模子迁徙通常需要跨过两道关:
1)让模子快速跑起来:兼容硬件情形、Pytorch模子、国产芯片已有算子等;;; ;;;;;
2)让模子跑得更快:定位推理链路中的瓶颈,,,,,,,并举行系统性优化。 。。。。。。。

古板流程往往依赖人工履历与重复试错,,,,,,,难以支持多模子版本、一连迭代的交付节奏。 。。。。。。。为此,,,,,,,我们将“规模;; ;;;;;逝 + 端到端优化”意会为一条可复现、可验证的交付链路,,,,,,,把迁徙从履历驱动的试错历程,,,,,,,转为可复制的工程流程。 。。。。。。。现在事情重点面向昇腾平台睁开,,,,,,,同时,,,,,,,焦点流程也已在其他国产芯片平台上完成起源可行性验证。 。。。。。。。

从“一次能跑”到“恒久可交付、可提速”

01

简介:

从“适配靠履历”到“交付靠系统”

古板跨平台迁徙往往泛起两类典范痛点:

? 情形碎片化:每个模子维护一套镜像,,,,,,,依赖冲突频发,,,,,,,迁徙全靠手工试错。 。。。。。。。

? 性能不可控:纵然“能跑”,,,,,,,端到端吞吐常被预处置惩罚、解码循环、算子选择等因素隐性瓶颈拖慢。 。。。。。。。

我们用Agent化的一体化计划把“适配—优化”串成一条链路。 。。。。。。。两个计划的对好比下:

 

02

国产算力上的规模;; ;;;;;W邮逝

我们将重大的硬件适配履历固化为可执行的智能体Skill事情流???????椋ㄗⅲ篠Kill事情流指的是让AI学会执行某项详细使命的专门能力或“手艺指南”)。 。。。。。。。这套面向AI智能体的“工程指南 + 工具集”,,,,,,,使智能体能够自动识别 NPU 驱动并通过多次试错中的履历,,,,,,,自主完成情形同步使命。 。。。。。。。交付效率与笼罩效果如下:

? 小时级极速适配:对一些主流模子,,,,,,,10 分钟内完成从情形设置到推理 Demo 运行;;; ;;;;;对绝大大都模子,,,,,,,1 小时内也可完成适配。 。。。。。。。

? 500+ 模子笼罩:我们接纳“深度精修”与“规模自动化”团结,,,,,,,完成了对 ChemDFM、ESM2、DINOv3 等科学盘算与前沿视觉标杆模子的深度适配;;; ;;;;;别的,,,,,,,依托多智能体协作机制,,,,,,,实现了 500+ 模子的自动适配。 。。。。。。。需注重,,,,,,,自动库着重于规模;; ;;;;;尚行匝橹,,,,,,,代码质量可能受模子重漂后影响保存波动,,,,,,,后续将团结 CI 机制举行长效自愈。 。。。。。。。

以下是部分主流模子的适配时间实测:

 

03

模子适配后的自动优化提速

在稳固运行模子后,,,,,,,下一个问题是:模子性能怎样进一步提升???????我们开发了一个更周全的智能体工具,,,,,,,可实现自动优化:以端到端视角自动定位性能瓶颈,,,,,,,并通过自界说解码循环、快速预处置惩罚管线等手段,,,,,,,自动天生并应用优化计划,,,,,,,实现性能提升。 。。。。。。。

我们较量了起源适配过的模子和自动优化后的模子,,,,,,,在7个代表性模子上完成系统验证:系统响应时间(用P50延迟来权衡)平均降低18.4%,,,,,,,最高降低38.0%;;; ;;;;;模子吞吐平均提升 23.3%(最高 64.6%)。 。。。。。。。下文是详细的比照:

名词诠释:延迟(latency)指一次请求从提倡到返回效果的端到端耗时;;; ;;;;;“P50 延迟”为延迟漫衍的 50% 分位点(中位数),,,,,,,反应典范请求的响应时间。 。。。。。。。

推理提速效果比照

注:起源适配后的模子与自动优化后的版本对齐了预热战略、测试数据与参数设置。 。。。。。。。

 

在一些典范案例上,,,,,,,我们找到的自动加速计划和效果如下:

? DINOv3:轻量模子的真实瓶颈常在预处置惩罚。 。。。。。。。以自界说快速预处置惩罚管线替换通用 ImageProcessor,,,,,,,使端到端 P50 降低 38.0%,,,,,,,吞吐提升 64.6%。 。。。。。。。

? GLM-OCR:通过 NPU ACL 算子级优化与推理路径精简(阻止不须要的 I/O),,,,,,,P50 降低 34.1%。 。。。。。。。

? BioGPT / ChemDFM:用自界说贪心解码循环替换通用 generate(),,,,,,,配合 KV Cache 治理与 ACL 高性能算子战略,,,,,,,实现 10%~15% 的端到端加速。 。。。。。。。

? GROVER:引入 SDPA 融合注重力并扩展预热笼罩序列长度,,,,,,,消除尾部延迟毛刺,,,,,,,实现 10.5% 的 P50 加速。 。。。。。。。

 

04

开发者行动:

在河套,,,,,,,共筑AI生态未来

现在自动适配工具SLAI-AscendBridge已开源;;; ;;;;;自动提速优化工具KernelCAT已开启内测,,,,,,,以申请制形式开放试用,,,,,,,接待开发者、科研机构与工业同伴配合完善国产算力的模子交付与性能工程能力。 。。。。。。。

 开源项目(AscendBridge|自动适配):https://gitcode.com/AI4Science/SLAI-AscendBridge(点击“阅读原文”即可跳转)

沉淀“人 + AI”深度适配履历,,,,,,,聚焦科学盘算与前沿标杆模子的高质量交付。 。。。。。。。

https://chongweiliu.github.io/slai-ascend-auto-adapt/dashboard/

实时展示通过多智能体协作实现的 500+ 模子全自动适配效果与运行状态。 。。。。。。。

● 性能优化能力(KernelCat|自动提速):目今以内测API形式开放,,,,,,,面向相助同伴提供接入与团结优化支持(接待申请内测)。 。。。。。。。




版权声明:本文转载自深圳河套学院官网,,,,,,,仅用于行业资讯交流与手艺分享,,,,,,,不代表本公司态度,,,,,,,不必于商业用途。 。。。。。。。版权归原作者及原出地方有,,,,,,,若有侵权,,,,,,,请联系OLE777实时删除。 。。。。。。。


OLE777官方网站 - 豪利OLE(中国)

OLE777官方网站 - 豪利OLE(中国)
在线咨询

4008-770-775

OLE777官方网站 - 豪利OLE(中国)
电话咨询
OLE777官方网站 - 豪利OLE(中国) TOP
【网站地图】【sitemap】