[{"data":1,"prerenderedAt":3550},["ShallowReactive",2],{"news-all-zh":3},[4,36,56,76,95,115,1809,1827,2006,2025,2044,2063,2082,2101,2120,2264,2305,2533,2593,2639,2752,2779,2805,2832,3309,3483],{"_path":5,"_dir":6,"_draft":7,"_partial":7,"_locale":8,"title":9,"description":10,"date":11,"cover":12,"type":13,"body":14,"_type":30,"_id":31,"_source":32,"_file":33,"_stem":34,"_extension":35},"\u002Fzh\u002Fnews\u002Fsimu-class1","news",false,"","灵衢协议仿真平台公开课-面向灵衢的超节点AI训推性能仿真",null,"2026\u002F07\u002F23 12:00","\u002Fcategory\u002Fnews\u002Fsimu-class\u002Fclass1-cover.jpg","events",{"type":15,"children":16,"toc":27},"root",[17],{"type":18,"tag":19,"props":20,"children":21},"element","p",{},[22],{"type":18,"tag":23,"props":24,"children":26},"img",{"alt":23,"src":25},"\u002Fcategory\u002Fnews\u002Fsimu-class\u002Fclass1.png",[],{"title":8,"searchDepth":28,"depth":28,"links":29},4,[],"markdown","content:zh:news:simu-class1.md","content","zh\u002Fnews\u002Fsimu-class1.md","zh\u002Fnews\u002Fsimu-class1","md",{"_path":37,"_dir":6,"_draft":7,"_partial":7,"_locale":8,"title":38,"description":10,"date":39,"cover":40,"type":13,"body":41,"_type":30,"_id":53,"_source":32,"_file":54,"_stem":55,"_extension":35},"\u002Fzh\u002Fnews\u002Flive-public-class9","灵衢协议解码公开课-安全解读","2026\u002F06\u002F10 18:00","\u002Fcategory\u002Fnews\u002Flive-public-class\u002Flive-public-class9-cover.jpg",{"type":15,"children":42,"toc":51},[43],{"type":18,"tag":19,"props":44,"children":45},{},[46],{"type":18,"tag":23,"props":47,"children":50},{"alt":48,"src":49},"安全解读公开课内容图","\u002Fcategory\u002Fnews\u002Flive-public-class\u002Flive-public-class9.jpg",[],{"title":8,"searchDepth":28,"depth":28,"links":52},[],"content:zh:news:live-public-class9.md","zh\u002Fnews\u002Flive-public-class9.md","zh\u002Fnews\u002Flive-public-class9",{"_path":57,"_dir":6,"_draft":7,"_partial":7,"_locale":8,"title":58,"description":10,"date":59,"cover":60,"type":13,"body":61,"_type":30,"_id":73,"_source":32,"_file":74,"_stem":75,"_extension":35},"\u002Fzh\u002Fnews\u002Flive-public-class8","灵衢协议解码公开课-资源管理解读","2026\u002F06\u002F09 18:00","\u002Fcategory\u002Fnews\u002Flive-public-class\u002Flive-public-class8-cover.jpg",{"type":15,"children":62,"toc":71},[63],{"type":18,"tag":19,"props":64,"children":65},{},[66],{"type":18,"tag":23,"props":67,"children":70},{"alt":68,"src":69},"内存管理公开课内容图","\u002Fcategory\u002Fnews\u002Flive-public-class\u002Flive-public-class8.jpg",[],{"title":8,"searchDepth":28,"depth":28,"links":72},[],"content:zh:news:live-public-class8.md","zh\u002Fnews\u002Flive-public-class8.md","zh\u002Fnews\u002Flive-public-class8",{"_path":77,"_dir":6,"_draft":7,"_partial":7,"_locale":8,"title":78,"description":10,"date":79,"cover":80,"type":13,"body":81,"_type":30,"_id":92,"_source":32,"_file":93,"_stem":94,"_extension":35},"\u002Fzh\u002Fnews\u002Flive-public-class7","灵衢协议解码公开课-内存管理解读","2026\u002F06\u002F04 18:00","\u002Fcategory\u002Fnews\u002Flive-public-class\u002Flive-public-class7-cover.jpg",{"type":15,"children":82,"toc":90},[83],{"type":18,"tag":19,"props":84,"children":85},{},[86],{"type":18,"tag":23,"props":87,"children":89},{"alt":68,"src":88},"\u002Fcategory\u002Fnews\u002Flive-public-class\u002Flive-public-class7.jpg",[],{"title":8,"searchDepth":28,"depth":28,"links":91},[],"content:zh:news:live-public-class7.md","zh\u002Fnews\u002Flive-public-class7.md","zh\u002Fnews\u002Flive-public-class7",{"_path":96,"_dir":6,"_draft":7,"_partial":7,"_locale":8,"title":97,"description":10,"date":98,"cover":99,"type":13,"body":100,"_type":30,"_id":112,"_source":32,"_file":113,"_stem":114,"_extension":35},"\u002Fzh\u002Fnews\u002Flive-public-class6","灵衢协议解码公开课-事务层+功能层解读","2026\u002F05\u002F30 18:00","\u002Fcategory\u002Fnews\u002Flive-public-class\u002Flive-public-class6-cover.jpg",{"type":15,"children":101,"toc":110},[102],{"type":18,"tag":19,"props":103,"children":104},{},[105],{"type":18,"tag":23,"props":106,"children":109},{"alt":107,"src":108},"img1","\u002Fcategory\u002Fnews\u002Flive-public-class\u002Flive-public-class6.jpg",[],{"title":8,"searchDepth":28,"depth":28,"links":111},[],"content:zh:news:live-public-class6.md","zh\u002Fnews\u002Flive-public-class6.md","zh\u002Fnews\u002Flive-public-class6",{"_path":116,"_dir":6,"_draft":7,"_partial":7,"_locale":8,"title":117,"description":118,"date":119,"cover":120,"type":6,"body":121,"_type":30,"_id":1806,"_source":32,"_file":1807,"_stem":1808,"_extension":35},"\u002Fzh\u002Fnews\u002Flarge-scale-ai-cluster-memory-access-mechanism-technology","UB核心优势之内存池化｜大规模AI集群内存访问机制技术深度解读","AI模型规模、上下文长度和推理链路持续增长，内存系统正在从单卡容量问题转变为跨卡、跨节点协同问题。仅增加单卡HBM容量，难以解决集群中内存分布不均、远端访问开销高和权限隔离复杂等问题。","2026\u002F05\u002F28 18:00","\u002Fcategory\u002Fnews\u002Flarge-scale-ai-cluster-memory-access-mechanism-technology\u002Fcover.png",{"type":15,"children":122,"toc":1790},[123,143,149,153,158,163,170,175,188,200,212,217,222,306,312,317,322,332,342,352,364,370,375,381,386,409,414,419,424,430,435,454,460,465,475,485,495,500,505,524,530,535,547,552,571,577,582,594,599,604,649,654,659,665,670,675,680,688,693,698,703,708,727,733,738,743,753,763,768,773,874,880,885,890,909,915,920,925,931,936,941,946,951,956,962,967,1039,1044,1049,1054,1060,1065,1070,1075,1084,1089,1095,1100,1105,1117,1122,1128,1133,1138,1209,1214,1233,1238,1276,1281,1325,1330,1343,1348,1354,1359,1364,1370,1382,1387,1392,1397,1402,1407,1413,1418,1423,1428,1433,1438,1457,1462,1669,1675,1680,1690,1700,1710,1720,1725,1731,1736,1741,1746,1751,1756,1761,1784],{"type":18,"tag":19,"props":124,"children":125},{},[126],{"type":18,"tag":127,"props":128,"children":129},"i",{},[130,133,141],{"type":131,"value":132},"text","编者按：文章转载自FreedomChips自由芯，原文链接接 ",{"type":18,"tag":134,"props":135,"children":139},"a",{"href":136,"rel":137},"https:\u002F\u002Fmp.weixin.qq.com\u002Fs\u002FJo2ftTk3Ncea9IsnlVpFpA",[138],"nofollow",[140],{"type":131,"value":136},{"type":131,"value":142}," 。",{"type":18,"tag":144,"props":145,"children":147},"h2",{"id":146},"引言",[148],{"type":131,"value":146},{"type":18,"tag":19,"props":150,"children":151},{},[152],{"type":131,"value":118},{"type":18,"tag":19,"props":154,"children":155},{},[156],{"type":131,"value":157},"UB（UnifiedBus，灵衢）协议从硬件栈底层定义跨节点内存访问机制。它把地址翻译、权限校验和Load\u002FStore访问语义扩展到跨节点范围，使远端HBM能够以受控、可验证、低CPU介入的方式参与计算。",{"type":18,"tag":19,"props":159,"children":160},{},[161],{"type":131,"value":162},"本文聚焦UB协议中的关键能力：跨节点内存池化。文章先提炼AI集群内存系统的主要约束，再梳理UB的设计思路、协议架构和硬件模块，随后通过一个两卡共享内存案例串联核心机制，最后回到AI负载场景分析其价值。",{"type":18,"tag":164,"props":165,"children":167},"h1",{"id":166},"一ai集群内存系统的三重困境",[168],{"type":131,"value":169},"一、AI集群内存系统的三重困境",{"type":18,"tag":19,"props":171,"children":172},{},[173],{"type":131,"value":174},"要理解UB的价值，需要先看清内存池化要解决的三个核心约束：容量、资源利用率和访问开销。",{"type":18,"tag":19,"props":176,"children":177},{},[178,180,186],{"type":131,"value":179},"第一是",{"type":18,"tag":181,"props":182,"children":183},"strong",{},[184],{"type":131,"value":185},"容量墙",{"type":131,"value":187},"。大模型权重、KV Cache、激活值和优化器状态会共同占用大量显存。单卡容量增长有限，模型部署越来越依赖多卡和多节点协同。",{"type":18,"tag":19,"props":189,"children":190},{},[191,193,198],{"type":131,"value":192},"第二是",{"type":18,"tag":181,"props":194,"children":195},{},[196],{"type":131,"value":197},"资源孤岛",{"type":131,"value":199},"。不同加速卡或节点上的HBM通常归属各自设备，空闲显存难以被其他计算任务直接使用。即使集群总显存充足，单个任务仍可能因本地显存不足而受限。",{"type":18,"tag":19,"props":201,"children":202},{},[203,205,210],{"type":131,"value":204},"第三是",{"type":18,"tag":181,"props":206,"children":207},{},[208],{"type":131,"value":209},"通信墙",{"type":131,"value":211},"。远端数据访问如果停留在显式搬运模式，应用需要处理注册、同步、鉴权、重试和调试等复杂流程。对于高频小粒度访问，软件提交与轮询路径还会引入额外CPU开销。",{"type":18,"tag":19,"props":213,"children":214},{},[215],{"type":131,"value":216},"这三个约束叠加后形成一个明确的工程矛盾：AI集群规模在增长，但跨卡、跨节点的有效内存协作能力没有同步提升。UB内存池化要解决的正是这种规模与协作能力之间的落差。",{"type":18,"tag":19,"props":218,"children":219},{},[220],{"type":131,"value":221},"表1汇总了三类约束及其根本原因。",{"type":18,"tag":223,"props":224,"children":225},"table",{},[226,250],{"type":18,"tag":227,"props":228,"children":229},"thead",{},[230],{"type":18,"tag":231,"props":232,"children":233},"tr",{},[234,240,245],{"type":18,"tag":235,"props":236,"children":237},"th",{},[238],{"type":131,"value":239},"困境",{"type":18,"tag":235,"props":241,"children":242},{},[243],{"type":131,"value":244},"表现",{"type":18,"tag":235,"props":246,"children":247},{},[248],{"type":131,"value":249},"根本原因",{"type":18,"tag":251,"props":252,"children":253},"tbody",{},[254,272,289],{"type":18,"tag":231,"props":255,"children":256},{},[257,262,267],{"type":18,"tag":258,"props":259,"children":260},"td",{},[261],{"type":131,"value":185},{"type":18,"tag":258,"props":263,"children":264},{},[265],{"type":131,"value":266},"单卡HBM难以承载持续增长的模型状态",{"type":18,"tag":258,"props":268,"children":269},{},[270],{"type":131,"value":271},"模型权重、KV Cache和训练状态增长快于单卡容量",{"type":18,"tag":231,"props":273,"children":274},{},[275,279,284],{"type":18,"tag":258,"props":276,"children":277},{},[278],{"type":131,"value":197},{"type":18,"tag":258,"props":280,"children":281},{},[282],{"type":131,"value":283},"集群总显存充足但局部设备显存紧张",{"type":18,"tag":258,"props":285,"children":286},{},[287],{"type":131,"value":288},"远端内存难以直接进入本地地址空间",{"type":18,"tag":231,"props":290,"children":291},{},[292,296,301],{"type":18,"tag":258,"props":293,"children":294},{},[295],{"type":131,"value":209},{"type":18,"tag":258,"props":297,"children":298},{},[299],{"type":131,"value":300},"高频小粒度远端访问开销高",{"type":18,"tag":258,"props":302,"children":303},{},[304],{"type":131,"value":305},"缺少统一的硬件级访问、翻译和权限校验语义",{"type":18,"tag":164,"props":307,"children":309},{"id":308},"二ub的架构哲学",[310],{"type":131,"value":311},"二、UB的架构哲学",{"type":18,"tag":19,"props":313,"children":314},{},[315],{"type":131,"value":316},"面对这三重困境，UB从硬件栈底层重新思考远端内存如何以接近本地内存的方式被访问，并围绕地址翻译、访问语义和权限校验建立完整机制。",{"type":18,"tag":19,"props":318,"children":319},{},[320],{"type":131,"value":321},"三个关键设计选择决定了UB的构造定位。",{"type":18,"tag":19,"props":323,"children":324},{},[325,330],{"type":18,"tag":181,"props":326,"children":327},{},[328],{"type":131,"value":329},"第一，把远端内存纳入硬件级地址翻译体系。",{"type":131,"value":331}," 在UB中，远端内存不仅是可传输的数据区域，也可以通过受控地址语义被访问。这要求接收方在每次访问时完成地址翻译与权限校验。执行该工作的模块是UMMU（UB Memory Management Unit），可以理解为CPU MMU跨节点语义的延伸。",{"type":18,"tag":19,"props":333,"children":334},{},[335,340],{"type":18,"tag":181,"props":336,"children":337},{},[338],{"type":131,"value":339},"第二，同时支持同步和异步两种访问语义。",{"type":131,"value":341}," UB提供URMA异步接口，也提供Load\u002FStore同步语义：CPU的一条mov指令可以触发远端HBM读写，访问方式与本地内存访问保持一致。这依赖发起侧的UBDecoder硬件，它把本地物理地址反向翻译为远端地址和描述符。",{"type":18,"tag":19,"props":343,"children":344},{},[345,350],{"type":18,"tag":181,"props":346,"children":347},{},[348],{"type":131,"value":349},"第三，把身份管理从数据面剥离。",{"type":131,"value":351}," UB引入分层标识符体系：CNA（Compact Network Address）表示路由到节点，EID（Entity identifier）定位到实体，TokenID指向内存段，UBA精确到字节，TokenValue验证权限。这些标识符各司其职，分别由UBFM（UB Fabric Manager）固件、UMMU硬件和应用软件等角色分配和使用。应用侧重点从网络路径管理转向凭据持有与访问语义。",{"type":18,"tag":19,"props":353,"children":354},{},[355,357,362],{"type":131,"value":356},"这三个设计选择共同构建了UB内存池化的基础：",{"type":18,"tag":181,"props":358,"children":359},{},[360],{"type":131,"value":361},"全局统一地址空间 + 双模态访问语义 + 硬件权限校验",{"type":131,"value":363},"。下一节我们从协议整体架构出发，看这三个设计如何落地到具体的硬件和协议层次上。",{"type":18,"tag":164,"props":365,"children":367},{"id":366},"三从协议架构看跨节点内存池化",[368],{"type":131,"value":369},"三、从协议架构看跨节点内存池化",{"type":18,"tag":19,"props":371,"children":372},{},[373],{"type":131,"value":374},"UB是一套完整的协议栈，规范将其定义为六层结构加上两个横向协作的独立模块。要理解内存池化，必须先建立对整体架构的直观认识，再从中识别出直接参与池化的功能单元。",{"type":18,"tag":144,"props":376,"children":378},{"id":377},"_31-ub协议整体架构",[379],{"type":131,"value":380},"3.1 UB协议整体架构",{"type":18,"tag":19,"props":382,"children":383},{},[384],{"type":131,"value":385},"规范第2.2章节描绘的UB协议栈从下往上依次是物理层、数据链路层、网络层、传输层、事务层和功能层，另有UMMU作为内存访问的旁路验证模块，UBFM作为全局资源管理的控制面实体。其抽象表达如下：",{"type":18,"tag":387,"props":388,"children":390},"div",{"style":389},"text-align: center;margin:24px 0;",[391,399],{"type":18,"tag":19,"props":392,"children":393},{},[394],{"type":18,"tag":23,"props":395,"children":398},{"alt":396,"src":397},"图1","\u002Fcategory\u002Fnews\u002Flarge-scale-ai-cluster-memory-access-mechanism-technology\u002Ffig1-ub-protocol-stack.png",[],{"type":18,"tag":19,"props":400,"children":401},{},[402],{"type":18,"tag":403,"props":404,"children":406},"span",{"style":405},"opacity: 0.8",[407],{"type":131,"value":408},"图1 UB协议栈与内存池化相关模块",{"type":18,"tag":19,"props":410,"children":411},{},[412],{"type":131,"value":413},"功能层把Load\u002FStore同步访问和URMA异步访问并列为两种合法的编程模型。应用既可以通过异步队列提交批量传输，也可以通过本地指针语义触发远端HBM细粒度访问。",{"type":18,"tag":19,"props":415,"children":416},{},[417],{"type":131,"value":418},"事务层把内存访问单列为一类事务，与消息传递、维护操作、管理消息并列。规范定义的Write（TAOpcode=0x03）、Read（0x06）、Atomic（0x07-0x0F）等事务类型都属于此类，它们是内存池化的直接协议承载。",{"type":18,"tag":19,"props":420,"children":421},{},[422],{"type":131,"value":423},"UMMU与UBFM作为协议栈旁路的独立模块存在。UMMU参与事务层的接收处理，承担地址翻译与权限校验；UBFM不参与任何单次事务处理，但负责全局身份分配和路由建立。它们不是协议栈的层，却是内存池化不可或缺的协作方。",{"type":18,"tag":144,"props":425,"children":427},{"id":426},"_32-ub系统的硬件组成",[428],{"type":131,"value":429},"3.2 UB系统的硬件组成",{"type":18,"tag":19,"props":431,"children":432},{},[433],{"type":131,"value":434},"再看规范第2.1章节图2-1描绘的UB Domain系统组成。一个UB Domain由若干UBPU（UB Processing Unit，UB协议处理单元）通过UB Link互联构成UB Fabric。每颗UBPU内部是计算核（CPU\u002FNPU\u002FGPU\u002F存储等不同类型）加上UB协议处理硬件的组合：",{"type":18,"tag":387,"props":436,"children":437},{"style":389},[438,446],{"type":18,"tag":19,"props":439,"children":440},{},[441],{"type":18,"tag":23,"props":442,"children":445},{"alt":443,"src":444},"图2","\u002Fcategory\u002Fnews\u002Flarge-scale-ai-cluster-memory-access-mechanism-technology\u002Ffig2-ub-domain-hardware.png",[],{"type":18,"tag":19,"props":447,"children":448},{},[449],{"type":18,"tag":403,"props":450,"children":451},{"style":405},[452],{"type":131,"value":453},"图2 UB Domain硬件组成",{"type":18,"tag":144,"props":455,"children":457},{"id":456},"_33-从架构到池化相关模块的角色定位",[458],{"type":131,"value":459},"3.3 从架构到池化：相关模块的角色定位",{"type":18,"tag":19,"props":461,"children":462},{},[463],{"type":131,"value":464},"把协议栈视图和硬件视图叠加起来，与内存池化直接相关的功能模块可以梳理为三组。",{"type":18,"tag":19,"props":466,"children":467},{},[468,473],{"type":18,"tag":181,"props":469,"children":470},{},[471],{"type":131,"value":472},"协议栈上的池化承载层。",{"type":131,"value":474}," 功能层暴露Load\u002FStore和URMA两种编程入口；事务层通过MAETAH（Memory Access Extended Transaction Header）扩展头承载UBA与TokenID，通过TVETAH（Token Value Extended Transaction Header）承载32-bit权限凭证，TVETAH的携带与否由BTAH中的TV_EN位控制，只有启用权限校验的事务才会附带它；传输层为内存访问提供可靠（RTP）、轻量（CTP）或直通（TP Bypass）三种传输语义；网络层负责跨节点路由并通过FECN实现拥塞感知；数据链路层与物理层则是向远程显存发出和接收字节流的基础承载。",{"type":18,"tag":19,"props":476,"children":477},{},[478,483],{"type":18,"tag":181,"props":479,"children":480},{},[481],{"type":131,"value":482},"UBPU内的池化专用硬件。",{"type":131,"value":484}," UB Controller是协议栈的主执行者，负责封包\u002F解包与Jetty管理；UMMU是接收方的地址翻译与权限校验引擎，是整个池化机制的守门员；UB Decoder位于发起方，在Load\u002FStore场景下把本地物理地址反向翻译为UBMD，让CPU的mov指令可以直达远端HBM；UB Switch是多端口的转发单元，负责ECMP路由与FECN标记。",{"type":18,"tag":19,"props":486,"children":487},{},[488,493],{"type":18,"tag":181,"props":489,"children":490},{},[491],{"type":131,"value":492},"控制平面的协调者。",{"type":131,"value":494}," UBFM作为运行在某颗UBPU上的固件，承担拓扑枚举、CNA\u002FEID分配、路由表下发等全局任务；OS驱动负责Jetty创建、内存段注册、UB Decoder页表维护等节点级管理。",{"type":18,"tag":19,"props":496,"children":497},{},[498],{"type":131,"value":499},"这三组模块不是孤立存在的，它们在内存池化的每个环节都有精确分工。接下来的章节将深入最核心的几个抽象。",{"type":18,"tag":19,"props":501,"children":502},{},[503],{"type":131,"value":504},"在展开细节之前，把后面反复出现的五个标识符先放在一张图上。内存池化的很多混淆都源于这套标识符体系。它们粒度由粗到细，分别回答访问谁的五个子问题：",{"type":18,"tag":387,"props":506,"children":507},{"style":389},[508,516],{"type":18,"tag":19,"props":509,"children":510},{},[511],{"type":18,"tag":23,"props":512,"children":515},{"alt":513,"src":514},"图3","\u002Fcategory\u002Fnews\u002Flarge-scale-ai-cluster-memory-access-mechanism-technology\u002Ffig3-ub-identifier-layers.png",[],{"type":18,"tag":19,"props":517,"children":518},{},[519],{"type":18,"tag":403,"props":520,"children":521},{"style":405},[522],{"type":131,"value":523},"图3 UB内存访问标识符分层",{"type":18,"tag":164,"props":525,"children":527},{"id":526},"四内存池化的核心抽象",[528],{"type":131,"value":529},"四、内存池化的核心抽象",{"type":18,"tag":19,"props":531,"children":532},{},[533],{"type":131,"value":534},"从协议细节回到概念层面，UB内存池化的运行可以归结为一个简洁模型加上三层协作机制。",{"type":18,"tag":19,"props":536,"children":537},{},[538,540,545],{"type":131,"value":539},"UB规范第九章首先建立了",{"type":18,"tag":181,"props":541,"children":542},{},[543],{"type":131,"value":544},"Home-User访问模型",{"type":131,"value":546},"：注册并提供内存资源的一方称为Home；访问远端内存的一方称为User。模型本身很直白，但意义深远：它把跨节点共享内存定义为两个分布式系统中常被误解的概念，还原为谁拥有、谁使用的清晰主客体关系。任何一次跨节点内存访问，在规范术语中都可以简化为User持凭据访问Home的过程。后面的所有讨论都在这一模型之上展开：Home通过内存注册生产凭据，User通过凭据发起访问，硬件在两侧分别完成各自的翻译与校验工作。",{"type":18,"tag":19,"props":548,"children":549},{},[550],{"type":131,"value":551},"围绕这个模型，三层机制层层递进：凭据系统让User能够精确表达我要访问哪块内存；翻译引擎在Home侧和User侧分别完成地址的正反翻译与权限校验；全局管理为前两者准备好网络身份与路由基础。三者环环相扣，缺一不可。",{"type":18,"tag":387,"props":553,"children":554},{"style":389},[555,563],{"type":18,"tag":19,"props":556,"children":557},{},[558],{"type":18,"tag":23,"props":559,"children":562},{"alt":560,"src":561},"图4","\u002Fcategory\u002Fnews\u002Flarge-scale-ai-cluster-memory-access-mechanism-technology\u002Ffig4-home-user-model.png",[],{"type":18,"tag":19,"props":564,"children":565},{},[566],{"type":18,"tag":403,"props":567,"children":568},{"style":405},[569],{"type":131,"value":570},"图4 Home-User访问模型",{"type":18,"tag":144,"props":572,"children":574},{"id":573},"_41-ubmd跨节点访问的凭据系统",[575],{"type":131,"value":576},"4.1 UBMD：跨节点访问的凭据系统",{"type":18,"tag":19,"props":578,"children":579},{},[580],{"type":131,"value":581},"UBMD（UB Memory Descriptor，UB内存描述符）是UB规范定义的三元组：",{"type":18,"tag":583,"props":584,"children":588},"pre",{"className":585,"code":587,"language":131,"meta":8},[586],"language-text","UBMD = { EID, TokenID, UBA }\n",[589],{"type":18,"tag":590,"props":591,"children":592},"code",{"__ignoreMap":8},[593],{"type":131,"value":587},{"type":18,"tag":19,"props":595,"children":596},{},[597],{"type":131,"value":598},"再配上一个独立传递的TokenValue，就构成了一次跨节点内存访问的完整凭据。",{"type":18,"tag":19,"props":600,"children":601},{},[602],{"type":131,"value":603},"这四个字段可以按访问定位与权限校验的层次来理解：",{"type":18,"tag":605,"props":606,"children":607},"ul",{},[608,619,629,639],{"type":18,"tag":609,"props":610,"children":611},"li",{},[612,617],{"type":18,"tag":181,"props":613,"children":614},{},[615],{"type":131,"value":616},"EID",{"type":131,"value":618},"标识目标内存归属的Entity。一颗UBPU可以承载多个Entity，每个Entity拥有独立资源配额，可服务不同租户或业务。",{"type":18,"tag":609,"props":620,"children":621},{},[622,627],{"type":18,"tag":181,"props":623,"children":624},{},[625],{"type":131,"value":626},"TokenID",{"type":131,"value":628},"标识Entity内的共享内存段。一个Entity可以注册多块内存段，TokenID用于选择对应的翻译与权限上下文。",{"type":18,"tag":609,"props":630,"children":631},{},[632,637],{"type":18,"tag":181,"props":633,"children":634},{},[635],{"type":131,"value":636},"UBA",{"type":131,"value":638},"（UB Address）表示段内逻辑地址。它由Home侧规划，不是物理地址，也不是User本地虚拟地址，而是Home Entity维护的地址空间，由UMMU翻译为真实物理地址。",{"type":18,"tag":609,"props":640,"children":641},{},[642,647],{"type":18,"tag":181,"props":643,"children":644},{},[645],{"type":131,"value":646},"TokenValue",{"type":131,"value":648},"是运行时权限凭据。它不属于UBMD本身，可独立轮换，用于细粒度权限管理。",{"type":18,"tag":19,"props":650,"children":651},{},[652],{"type":131,"value":653},"这四者缺一不可：EID定位实体，TokenID定位内存段，UBA定位段内字节，TokenValue负责权限验证。任一字段不匹配都会导致访问失败，这是多租户场景下硬件级隔离的基础。",{"type":18,"tag":19,"props":655,"children":656},{},[657],{"type":131,"value":658},"一个值得注意的细节：规范允许MAPTE（MAPT Entry）同时存储主和备两个TokenValue。初始注册时两者可以相同也可以不同。这个设计为权限管理保留了更灵活的操作空间。若不同User或租户被分配了不同的TokenValue，需要撤销某个用户但保留其他用户的访问时，只需替换对应TokenValue即可，无需销毁整个内存段。这使权限回收可以在不销毁内存段的情况下完成，在大规模多租户环境下具有实际价值。",{"type":18,"tag":144,"props":660,"children":662},{"id":661},"_42-ummu与ub-decoder地址翻译的两端",[663],{"type":131,"value":664},"4.2 UMMU与UB Decoder：地址翻译的两端",{"type":18,"tag":19,"props":666,"children":667},{},[668],{"type":131,"value":669},"UMMU（UB Memory Management Unit）位于每个Home侧UBPU内部，是内存池化的核心硬件执行者。它和CPU的MMU在功能上高度相似，都负责虚拟地址到物理地址的翻译和权限校验，区别在于CPU MMU服务于本机进程的虚拟地址空间，UMMU服务于跨节点访问产生的虚拟地址请求。",{"type":18,"tag":19,"props":671,"children":672},{},[673],{"type":131,"value":674},"每当一个远端访问请求到达UMMU，它会在硬件流水线中完成四步验证，避免让CPU介入单次权限判断。首先按DEID查TECT（Target Entity Configuration Table），获得该Entity对应的TCT基址；然后按TokenID查TCT（Target Context Table），获得该内存段对应的MATT基址与MAPT基址；接着按UBA走MATT（Memory Address Translation Table）的多级页表，翻译出真实物理地址；最后按UBA查MAPT（Memory Address Permission Table），比对请求携带的TokenValue是否匹配MAPTE中的主\u002F备锁，并校验Permission是否包含请求的访问类型。四步全部通过后，DMA引擎才会实际访问物理内存。",{"type":18,"tag":19,"props":676,"children":677},{},[678],{"type":131,"value":679},"UMMU的设计中还有一个特别值得一提的细节：它支持两阶段地址翻译。Stage 1把UBA翻译为IPA（中间物理地址），Stage 2把IPA翻译为PA（真实物理地址）。这不仅完整对齐了ARM SMMU在虚拟化场景下的地址转换语义，一个Entity被直通给虚拟机时，Stage 1由Guest OS控制，Stage 2由Hypervisor控制，多租户的虚拟化隔离由硬件直接保证。这让UB Entity的虚拟化直通成为一种自然的硬件能力，而不是软件模拟出来的效果。",{"type":18,"tag":19,"props":681,"children":682},{},[683],{"type":18,"tag":181,"props":684,"children":685},{},[686],{"type":131,"value":687},"User侧：UB Decoder的反向翻译。",{"type":18,"tag":19,"props":689,"children":690},{},[691],{"type":131,"value":692},"单靠UMMU只能解决Home如何验证外来请求的问题。要让Load\u002FStore同步访问成立，还需要在User侧有一个反向的翻译机制，这就是UB Decoder的角色。",{"type":18,"tag":19,"props":694,"children":695},{},[696],{"type":131,"value":697},"UB Decoder管理一套两级本地页表（L0\u002FL1 PTE），把本地物理地址范围映射到远端UBMD。当CPU发出一条mov指令访问某个内存地址时，UB Decoder拦截这次访问，查本地页表得到{EID, TokenID, UBA_BASE, TokenValue}，把本地物理地址的低位拼到UBA_BASE上形成完整的UBA。这组信息交给UB Controller封包发送，对CPU而言整个过程完全透明，从CPU视角看，这仍然是一次Load\u002FStore访问；跨芯片细节由UB Decoder和UB Controller处理。",{"type":18,"tag":19,"props":699,"children":700},{},[701],{"type":131,"value":702},"UMMU和UB Decoder的关系可以这样概括：User侧UB Decoder把物理地址反向翻译为UBMD（PA到UBMD），Home侧UMMU把UBMD正向翻译为物理地址（UBMD到PA）。两端各自管理各自的页表，互不干扰。URMA异步访问则只走Home侧UMMU这一半，因为应用已经直接在WQE里提供了UBMD，不需要UB Decoder做反向翻译。",{"type":18,"tag":19,"props":704,"children":705},{},[706],{"type":131,"value":707},"这里有一个根本的工程哲学：内存池化的权限控制必须在硬件完成，不能依赖软件。AI训练场景下单秒可能有数百万次远端内存访问，如果每次都需要CPU介入校验，软件根本扛不住。UMMU与UB Decoder的硬件化设计把单次翻译与校验从CPU调用路径中移出，让低CPU开销的池化访问从愿望变成现实。",{"type":18,"tag":387,"props":709,"children":710},{"style":389},[711,719],{"type":18,"tag":19,"props":712,"children":713},{},[714],{"type":18,"tag":23,"props":715,"children":718},{"alt":716,"src":717},"图5","\u002Fcategory\u002Fnews\u002Flarge-scale-ai-cluster-memory-access-mechanism-technology\u002Ffig5-ummu-verification-flow.png",[],{"type":18,"tag":19,"props":720,"children":721},{},[722],{"type":18,"tag":403,"props":723,"children":724},{"style":405},[725],{"type":131,"value":726},"图5 UMMU四步验证流水",{"type":18,"tag":144,"props":728,"children":730},{"id":729},"_43-ubfm全局资源的调度中枢",[731],{"type":131,"value":732},"4.3 UBFM：全局资源的调度中枢",{"type":18,"tag":19,"props":734,"children":735},{},[736],{"type":131,"value":737},"凭据系统和翻译引擎解决的是单次访问怎么做，但任何一次跨节点访问成立的前提是：两颗芯片都已经拥有网络身份，路由表已经配好，Entity上下文已经建立。这些全局性的准备工作落在UBFM（UB Fabric Manager）身上。",{"type":18,"tag":19,"props":739,"children":740},{},[741],{"type":131,"value":742},"UBFM是运行在某颗UBPU上的固件，负责超节点级的全局管理。它不参与任何单次数据访问，但没有它的前期工作，内存池化根本无从建立。UBFM的工作可以概括为三件事。",{"type":18,"tag":19,"props":744,"children":745},{},[746,751],{"type":18,"tag":181,"props":747,"children":748},{},[749],{"type":131,"value":750},"枚举与身份分配：",{"type":131,"value":752}," 系统上电后UBFM通过拓扑查询命令发现每颗UBPU，按规划分配Primary CNA与EID，并通过Configure CNA与Entity Registration命令写入各UBPU的配置空间。CNA决定网络中这个UBPU被如何寻址；EID决定这个软件实体被如何标识。",{"type":18,"tag":19,"props":754,"children":755},{},[756,761],{"type":18,"tag":181,"props":757,"children":758},{},[759],{"type":131,"value":760},"路由表与分区：",{"type":131,"value":762}," UBFM基于拓扑生成路由与多路径信息，生成路由表并下发到各UB Switch的1GB路由表区。协同与维护、Entity注册、UPI分区、热插拔、故障恢复等事件都由UBFM协调处理。",{"type":18,"tag":19,"props":764,"children":765},{},[766],{"type":131,"value":767},"一个不常被注意到的事实是：UBFM本身跑在UB内部，它使用的网络正是它自己在管理的网络。这种自举设计需要UBFM通过一些特殊的Bootstrap机制，如保留的UPI=0x7FFF管理分区，在网络完全就绪之前也能工作。控制面和数据面共享物理链路，但通过保留特权身份避开了鸡生蛋的循环依赖。",{"type":18,"tag":19,"props":769,"children":770},{},[771],{"type":131,"value":772},"表2总结了凭据系统、翻译引擎和全局管理之间的分工。",{"type":18,"tag":223,"props":774,"children":775},{},[776,802],{"type":18,"tag":227,"props":777,"children":778},{},[779],{"type":18,"tag":231,"props":780,"children":781},{},[782,787,792,797],{"type":18,"tag":235,"props":783,"children":784},{},[785],{"type":131,"value":786},"机制",{"type":18,"tag":235,"props":788,"children":789},{},[790],{"type":131,"value":791},"承载组件",{"type":18,"tag":235,"props":793,"children":794},{},[795],{"type":131,"value":796},"职责",{"type":18,"tag":235,"props":798,"children":799},{},[800],{"type":131,"value":801},"典型触发时机",{"type":18,"tag":251,"props":803,"children":804},{},[805,828,851],{"type":18,"tag":231,"props":806,"children":807},{},[808,813,818,823],{"type":18,"tag":258,"props":809,"children":810},{},[811],{"type":131,"value":812},"凭据系统",{"type":18,"tag":258,"props":814,"children":815},{},[816],{"type":131,"value":817},"UBMD + TokenValue",{"type":18,"tag":258,"props":819,"children":820},{},[821],{"type":131,"value":822},"表达访问哪块内存+有无权限",{"type":18,"tag":258,"props":824,"children":825},{},[826],{"type":131,"value":827},"Home注册内存时生成，访问时携带",{"type":18,"tag":231,"props":829,"children":830},{},[831,836,841,846],{"type":18,"tag":258,"props":832,"children":833},{},[834],{"type":131,"value":835},"翻译引擎",{"type":18,"tag":258,"props":837,"children":838},{},[839],{"type":131,"value":840},"UMMU（Home侧）+ UB Decoder（User侧）",{"type":18,"tag":258,"props":842,"children":843},{},[844],{"type":131,"value":845},"地址正反翻译 + 权限校验",{"type":18,"tag":258,"props":847,"children":848},{},[849],{"type":131,"value":850},"每次访问都执行",{"type":18,"tag":231,"props":852,"children":853},{},[854,859,864,869],{"type":18,"tag":258,"props":855,"children":856},{},[857],{"type":131,"value":858},"全局管理",{"type":18,"tag":258,"props":860,"children":861},{},[862],{"type":131,"value":863},"UBFM",{"type":18,"tag":258,"props":865,"children":866},{},[867],{"type":131,"value":868},"网络身份分配、路由下发、资源协调",{"type":18,"tag":258,"props":870,"children":871},{},[872],{"type":131,"value":873},"系统上电 + 拓扑变化时",{"type":18,"tag":164,"props":875,"children":877},{"id":876},"五完整剖析一次跨节点内存共享是如何发生的",[878],{"type":131,"value":879},"五、完整剖析：一次跨节点内存共享是如何发生的",{"type":18,"tag":19,"props":881,"children":882},{},[883],{"type":131,"value":884},"抽象概念需要具体场景来落地。下面用一个完整案例串起所有机制：GPU A借用NPU B的64MB HBM存放训练中的激活值。这个场景刻意选得简单，以便专注于流程本身；更复杂的多节点、多租户场景只是规模上的叠加。",{"type":18,"tag":19,"props":886,"children":887},{},[888],{"type":131,"value":889},"整个建链与访问过程可以划分为七个阶段，时间轴与关键动作如下：",{"type":18,"tag":387,"props":891,"children":892},{"style":389},[893,901],{"type":18,"tag":19,"props":894,"children":895},{},[896],{"type":18,"tag":23,"props":897,"children":900},{"alt":898,"src":899},"图6","\u002Fcategory\u002Fnews\u002Flarge-scale-ai-cluster-memory-access-mechanism-technology\u002Ffig6-cross-node-memory-sharing.png",[],{"type":18,"tag":19,"props":902,"children":903},{},[904],{"type":18,"tag":403,"props":905,"children":906},{"style":405},[907],{"type":131,"value":908},"图6 跨节点内存共享阶段",{"type":18,"tag":144,"props":910,"children":912},{"id":911},"_51-上电物理基础的建立",[913],{"type":131,"value":914},"5.1 上电：物理基础的建立",{"type":18,"tag":19,"props":916,"children":917},{},[918],{"type":131,"value":919},"故事从系统上电开始。两颗UBPU通过UB Link连接。物理层LMSM状态机完成Lane训练、速率协商、FEC配置，进入Link_Active状态。数据链路层初始化信用流控，双方交换Init Block协商链路参数。",{"type":18,"tag":19,"props":921,"children":922},{},[923],{"type":131,"value":924},"这个阶段两颗芯片完成了物理意义上的握手，线已经通了，但上层一片空白：没有网络地址，没有通信端点，没有任何应用可以跨芯片交流。它们只是两颗知道对方存在的芯片，还不构成一个超节点。",{"type":18,"tag":144,"props":926,"children":928},{"id":927},"_52-ubfm登场从芯片到超节点",[929],{"type":131,"value":930},"5.2 UBFM登场：从芯片到超节点",{"type":18,"tag":19,"props":932,"children":933},{},[934],{"type":131,"value":935},"超节点的成形始于UBFM的登台。系统某个UBPU在启动的时候被确定为UBFM角色，它开始在整个Fabric内部扫描、编目、分配。",{"type":18,"tag":19,"props":937,"children":938},{},[939],{"type":131,"value":940},"首先是拓扑枚举。UBFM从自己出发，向每个直连邻居发送拓扑查询命令（Configure CNA命令CMD=0），邻居返回本节点信息后，UBFM继续向它们的邻居查询，按广度优先遍历扫遍整个超节点。这个过程类似传统网络中的邻居发现协议，但通信基础是UB自己的报文格式。",{"type":18,"tag":19,"props":942,"children":943},{},[944],{"type":131,"value":945},"然后是身份分配。UBFM为每颗UBPU分配Primary CNA（24-bit节点地址），为每个Entity分配EID（128-bit实体标识）。这些值通过Configure CNA与Entity Registration命令下发，写入对应UBPU的CFGO_BASIC寄存器。假设GPU A得到CNA=0x1001，NPU B得到CNA=0x2002（例子使用16-bit CNA模式，对应后续CFG=9的9场景）；两颗芯片各自的业务Entity分别得到EID_A与EID_B。",{"type":18,"tag":19,"props":947,"children":948},{},[949],{"type":131,"value":950},"最后是路由下发。UBFM基于拓扑运行最短路径算法（包含ECMP支持和环路避免约束），计算出每个UB Switch应如何转发到任意目标CNA，把这些路由条目写入各UB Switch的CFG0_ROUTE_TABLE。",{"type":18,"tag":19,"props":952,"children":953},{},[954],{"type":131,"value":955},"这一阶段结束时，整个超节点具备了最基础的网络可达性。GPU A发一个DCNA=0x2002的包，UB Switch能准确送达NPU B。但应用还不能互通，缺少传输层和事务层的通信上下文。",{"type":18,"tag":144,"props":957,"children":959},{"id":958},"_53-npu-b注册内存把本地hbm变成可共享资源",[960],{"type":131,"value":961},"5.3 NPU B注册内存：把本地HBM变成可共享资源",{"type":18,"tag":19,"props":963,"children":964},{},[965],{"type":131,"value":966},"现在轮到NPU B的应用主动出场。它调用一个注册接口：",{"type":18,"tag":583,"props":968,"children":972},{"className":969,"code":970,"language":971,"meta":8,"style":8},"language-c shiki shiki-themes github-light github-dark monokai","urma_register_seg(\nctx,\n.addr = shared_buf,\n.size = 64 * 1024 * 1024,\n.perm = URMA_ACCESS_READ | URMA_ACCESS_WRITE,\n&token_id, &uba_base, &token_value\n);\n","c",[973],{"type":18,"tag":590,"props":974,"children":975},{"__ignoreMap":8},[976,986,995,1004,1012,1021,1030],{"type":18,"tag":403,"props":977,"children":980},{"class":978,"line":979},"line",1,[981],{"type":18,"tag":403,"props":982,"children":983},{},[984],{"type":131,"value":985},"urma_register_seg(\n",{"type":18,"tag":403,"props":987,"children":989},{"class":978,"line":988},2,[990],{"type":18,"tag":403,"props":991,"children":992},{},[993],{"type":131,"value":994},"ctx,\n",{"type":18,"tag":403,"props":996,"children":998},{"class":978,"line":997},3,[999],{"type":18,"tag":403,"props":1000,"children":1001},{},[1002],{"type":131,"value":1003},".addr = shared_buf,\n",{"type":18,"tag":403,"props":1005,"children":1006},{"class":978,"line":28},[1007],{"type":18,"tag":403,"props":1008,"children":1009},{},[1010],{"type":131,"value":1011},".size = 64 * 1024 * 1024,\n",{"type":18,"tag":403,"props":1013,"children":1015},{"class":978,"line":1014},5,[1016],{"type":18,"tag":403,"props":1017,"children":1018},{},[1019],{"type":131,"value":1020},".perm = URMA_ACCESS_READ | URMA_ACCESS_WRITE,\n",{"type":18,"tag":403,"props":1022,"children":1024},{"class":978,"line":1023},6,[1025],{"type":18,"tag":403,"props":1026,"children":1027},{},[1028],{"type":131,"value":1029},"&token_id, &uba_base, &token_value\n",{"type":18,"tag":403,"props":1031,"children":1033},{"class":978,"line":1032},7,[1034],{"type":18,"tag":403,"props":1035,"children":1036},{},[1037],{"type":131,"value":1038},");\n",{"type":18,"tag":19,"props":1040,"children":1041},{},[1042],{"type":131,"value":1043},"这行代码背后发生了相当多的事情。OS驱动首先锁定64 MB物理页（Pin住，防止被操作系统换出），然后向UMMU申请一个空闲的TCT条目，UMMU分配TokenID=0x00042。驱动规划一段UBA虚拟地址区间，比如从0x10_0000_0000到0x10_0400_0000，正好64MB。接着生成TokenValue（用硬件RNG或软件随机数，比如0xCAFE_BABE）。",{"type":18,"tag":19,"props":1045,"children":1046},{},[1047],{"type":131,"value":1048},"然后驱动要填四张UMMU硬件表：TECTE告诉UMMU这个Entity的TCT基址在哪；新分配的TCTE指向该段的MATT与MAPT；MATT建立UBA到物理地址的多级映射；MAPTE填入Permission=RW和主\u002F备TokenValue。",{"type":18,"tag":19,"props":1050,"children":1051},{},[1052],{"type":131,"value":1053},"至此，NPU B的UMMU硬件已经知道这段64 MB内存的存在，并且拥有完整的访问控制策略。但这些映射和权限上下文仍位于NPU B本地，GPU A需要后续凭据分发才能访问。",{"type":18,"tag":144,"props":1055,"children":1057},{"id":1056},"_54-凭据分发带外通道的角色",[1058],{"type":131,"value":1059},"5.4 凭据分发：带外通道的角色",{"type":18,"tag":19,"props":1061,"children":1062},{},[1063],{"type":131,"value":1064},"UBMD与TokenValue组成的四元组，必须从NPU B传递到GPU A，两者才能建立数据面通信。UB规范没有强制规定分发方式，这实际上属于带外通道的职责。",{"type":18,"tag":19,"props":1066,"children":1067},{},[1068],{"type":131,"value":1069},"典型的选择是走TCP\u002FIP管理网络：两侧应用守护进程通过集群协调服务（如etcd\u002FZooKeeper）交换元数据。更高安全性的场景会经UBFM中转，由UBFM基于全局权限策略控制凭据流向。少数实现也会通过UB的公知Jetty 1（事务层信息交换端点）做分发，但这要求基础通信已经建立。",{"type":18,"tag":19,"props":1071,"children":1072},{},[1073],{"type":131,"value":1074},"不论走哪条路，分发的都是同一个四元组：",{"type":18,"tag":583,"props":1076,"children":1079},{"className":1077,"code":1078,"language":131,"meta":8},[586],"{ home_eid, token_id, uba_base, size, token_value, permissions }\n",[1080],{"type":18,"tag":590,"props":1081,"children":1082},{"__ignoreMap":8},[1083],{"type":131,"value":1078},{"type":18,"tag":19,"props":1085,"children":1086},{},[1087],{"type":131,"value":1088},"值得一提的是，TokenValue相当于访问密码，明文传输有泄露风险。UB规范的CIP机制（AES-GCM \u002F SM4-GCM）可以为数据面加密，但带外通道自身的安全性需要管理面另行保障。在可信网络内部可以简化处理，跨安全域传输时必须加密。",{"type":18,"tag":144,"props":1090,"children":1092},{"id":1091},"_55-建链从还不能发到可以发",[1093],{"type":131,"value":1094},"5.5 建链：从还不能发到可以发",{"type":18,"tag":19,"props":1096,"children":1097},{},[1098],{"type":131,"value":1099},"GPU A现在手握凭据，但不同访问路径还需要不同的本地准备工作：URMA路径需要传输层TP Channel和应用层Jetty；LD-ST路径则需要UB Decoder映射和对应的一致性\u002F访问属性配置。",{"type":18,"tag":19,"props":1101,"children":1102},{},[1103],{"type":131,"value":1104},"URMA路径的TP Channel建立由UB Controller硬件与固件协同完成。规范第6.3.1章节明确TP Channel的具体建立流程不在本规范定义范围内，这是UB规范目前的一个留白。但可以将它合理抽象为：两端由系统软件，典型做法是通过公知Jetty 0（传输层信息交换端点）完成协商；双方协商TPN分配、PSN初值、BitMapSize、拥塞算法类型、MTU等关键参数。协商完成后各自建立TP Channel上下文。多条TP Channel通常组成一个TPG（Transport Channel Group），用于后续的多路径负载均衡和带宽聚合。",{"type":18,"tag":19,"props":1106,"children":1107},{},[1108,1110,1115],{"type":131,"value":1109},"Jetty创建也是URMA路径的应用层准备。GPU A调用urma_create_jetty创建一个通信端点，驱动从",{"type":18,"tag":403,"props":1111,"children":1112},{},[1113],{"type":131,"value":1114},"32, 1023",{"type":131,"value":1116},"范围分配Jetty ID，配置Jetty Context Table（JETC）、权限与JFC，为配套的SQ与RQ缓冲区分配内存页。Jetty在UB协议中是URMA编程模型的基本通信单元，可以理解为自带硬件队列的socket。LD-ST路径不依赖Jetty队列，而是依赖UB Decoder页表把本地地址窗口映射到远端UBMD。",{"type":18,"tag":19,"props":1118,"children":1119},{},[1120],{"type":131,"value":1121},"这里需要特别澄清一个容易混淆的点：由于GPU A执行的是Write\u002FRead（内存语义）而非Send（消息语义），NPU B侧不需要创建专门的接收Jetty。UMMU会直接按UBMD定位内存并完成访问，不经过NPU B的任何Jetty。这是内存语义最典型的单边特征：发起方需要完整的访问凭据，接收方只需暴露UMMU表项。相比之下，如果GPU A要发Send消息给NPU B，则NPU B必须有接收Jetty且已经在RQ挂好接收缓冲，发送方还需显式携带目标Jetty标识（MTETAH.TGT_TC_ID），那是另一套路径。",{"type":18,"tag":144,"props":1123,"children":1125},{"id":1124},"_56-真正的访问urma和ld-st两条路径",[1126],{"type":131,"value":1127},"5.6 真正的访问：URMA和LD-ST两条路径",{"type":18,"tag":19,"props":1129,"children":1130},{},[1131],{"type":131,"value":1132},"一切就绪后，GPU A终于可以访问NPU B的内存了。UB提供两条访问路径，覆盖不同的性能需求。",{"type":18,"tag":19,"props":1134,"children":1135},{},[1136],{"type":131,"value":1137},"URMA路径让应用通过API显式发起：",{"type":18,"tag":583,"props":1139,"children":1141},{"className":969,"code":1140,"language":971,"meta":8,"style":8},"urma_post_jetty_send_wr(\njetty_a,\n.opc = URMA_WRITE,\n.local_buf = activation_data,\n.length = 40 * 1024 * 1024,\n.remote = { EID_B, 0x00042, 0x10_0000_0000, 0xCAFE_BABE },\n.wr_id = step_id\n);\n",[1142],{"type":18,"tag":590,"props":1143,"children":1144},{"__ignoreMap":8},[1145,1153,1161,1169,1177,1185,1193,1201],{"type":18,"tag":403,"props":1146,"children":1147},{"class":978,"line":979},[1148],{"type":18,"tag":403,"props":1149,"children":1150},{},[1151],{"type":131,"value":1152},"urma_post_jetty_send_wr(\n",{"type":18,"tag":403,"props":1154,"children":1155},{"class":978,"line":988},[1156],{"type":18,"tag":403,"props":1157,"children":1158},{},[1159],{"type":131,"value":1160},"jetty_a,\n",{"type":18,"tag":403,"props":1162,"children":1163},{"class":978,"line":997},[1164],{"type":18,"tag":403,"props":1165,"children":1166},{},[1167],{"type":131,"value":1168},".opc = URMA_WRITE,\n",{"type":18,"tag":403,"props":1170,"children":1171},{"class":978,"line":28},[1172],{"type":18,"tag":403,"props":1173,"children":1174},{},[1175],{"type":131,"value":1176},".local_buf = activation_data,\n",{"type":18,"tag":403,"props":1178,"children":1179},{"class":978,"line":1014},[1180],{"type":18,"tag":403,"props":1181,"children":1182},{},[1183],{"type":131,"value":1184},".length = 40 * 1024 * 1024,\n",{"type":18,"tag":403,"props":1186,"children":1187},{"class":978,"line":1023},[1188],{"type":18,"tag":403,"props":1189,"children":1190},{},[1191],{"type":131,"value":1192},".remote = { EID_B, 0x00042, 0x10_0000_0000, 0xCAFE_BABE },\n",{"type":18,"tag":403,"props":1194,"children":1195},{"class":978,"line":1032},[1196],{"type":18,"tag":403,"props":1197,"children":1198},{},[1199],{"type":131,"value":1200},".wr_id = step_id\n",{"type":18,"tag":403,"props":1202,"children":1204},{"class":978,"line":1203},8,[1205],{"type":18,"tag":403,"props":1206,"children":1207},{},[1208],{"type":131,"value":1038},{"type":18,"tag":19,"props":1210,"children":1211},{},[1212],{"type":131,"value":1213},"UB Controller读取这条WQE，查Jetty Context找到绑定的TPG，TPG调度选择一条TP Channel，得到SrcTPN和DstTPN，分配一个INI_RC_ID记录SQ Context（用于后续响应匹配），查EID-CNA获得DCNA。40 MB数据按MTU切成若干TP Packet，每个包自动加PSN、计算ICRC。包头里的MAETAH携带UB Address与TokenID，TVETAH携带TokenValue，CFG字段根据访问类型派生为9（16-bit CNA）。这些工作几乎全部由硬件自主完成，应用只提供了WQE里的几个核心字段。",{"type":18,"tag":387,"props":1215,"children":1216},{"style":389},[1217,1225],{"type":18,"tag":19,"props":1218,"children":1219},{},[1220],{"type":18,"tag":23,"props":1221,"children":1224},{"alt":1222,"src":1223},"图7","\u002Fcategory\u002Fnews\u002Flarge-scale-ai-cluster-memory-access-mechanism-technology\u002Ffig7-urma-write-path.png",[],{"type":18,"tag":19,"props":1226,"children":1227},{},[1228],{"type":18,"tag":403,"props":1229,"children":1230},{"style":405},[1231],{"type":131,"value":1232},"图7 URMA Write包处理路径",{"type":18,"tag":19,"props":1234,"children":1235},{},[1236],{"type":131,"value":1237},"LD-ST路径面向同步细粒度访问，将远端访问映射到本地内存地址范围。配置阶段驱动把UBMD写入UB Decoder的两级页表，建立本地物理地址范围到远端UBMD的映射：",{"type":18,"tag":583,"props":1239,"children":1241},{"className":969,"code":1240,"language":971,"meta":8,"style":8},"ub_decoder_map(\n.local_pa_range = { 0x7F_E000_0000, 0x7F_E400_0000 },\n.remote_ubmd = { EID_B, 0x00042, 0x10_0000_0000, 0xCAFE_BABE }\n);\n",[1242],{"type":18,"tag":590,"props":1243,"children":1244},{"__ignoreMap":8},[1245,1253,1261,1269],{"type":18,"tag":403,"props":1246,"children":1247},{"class":978,"line":979},[1248],{"type":18,"tag":403,"props":1249,"children":1250},{},[1251],{"type":131,"value":1252},"ub_decoder_map(\n",{"type":18,"tag":403,"props":1254,"children":1255},{"class":978,"line":988},[1256],{"type":18,"tag":403,"props":1257,"children":1258},{},[1259],{"type":131,"value":1260},".local_pa_range = { 0x7F_E000_0000, 0x7F_E400_0000 },\n",{"type":18,"tag":403,"props":1262,"children":1263},{"class":978,"line":997},[1264],{"type":18,"tag":403,"props":1265,"children":1266},{},[1267],{"type":131,"value":1268},".remote_ubmd = { EID_B, 0x00042, 0x10_0000_0000, 0xCAFE_BABE }\n",{"type":18,"tag":403,"props":1270,"children":1271},{"class":978,"line":28},[1272],{"type":18,"tag":403,"props":1273,"children":1274},{},[1275],{"type":131,"value":1038},{"type":18,"tag":19,"props":1277,"children":1278},{},[1279],{"type":131,"value":1280},"运行时CPU\u002FNPU直接用本地指针访问（注：如果NPU具备通信卸载能力，LD-ST访问可由NPU自己发起）：",{"type":18,"tag":583,"props":1282,"children":1284},{"className":969,"code":1283,"language":971,"meta":8,"style":8},"int *remote_ptr = (int*)0x7F_E000_1000;\nint value = *remote_ptr;                    \u002F\u002F 读远端HBM\n*remote_ptr = 42;                           \u002F\u002F 写远端HBM\n__sync_fetch_and_add(remote_ptr, 1);         \u002F\u002F 远端原子加\n",[1285],{"type":18,"tag":590,"props":1286,"children":1287},{"__ignoreMap":8},[1288,1296,1304,1317],{"type":18,"tag":403,"props":1289,"children":1290},{"class":978,"line":979},[1291],{"type":18,"tag":403,"props":1292,"children":1293},{},[1294],{"type":131,"value":1295},"int *remote_ptr = (int*)0x7F_E000_1000;\n",{"type":18,"tag":403,"props":1297,"children":1298},{"class":978,"line":988},[1299],{"type":18,"tag":403,"props":1300,"children":1301},{},[1302],{"type":131,"value":1303},"int value = *remote_ptr;                    \u002F\u002F 读远端HBM\n",{"type":18,"tag":403,"props":1305,"children":1306},{"class":978,"line":997},[1307,1312],{"type":18,"tag":403,"props":1308,"children":1309},{},[1310],{"type":131,"value":1311},"*remote_ptr = 42;",{"type":18,"tag":403,"props":1313,"children":1314},{},[1315],{"type":131,"value":1316},"                           \u002F\u002F 写远端HBM\n",{"type":18,"tag":403,"props":1318,"children":1319},{"class":978,"line":28},[1320],{"type":18,"tag":403,"props":1321,"children":1322},{},[1323],{"type":131,"value":1324},"__sync_fetch_and_add(remote_ptr, 1);         \u002F\u002F 远端原子加\n",{"type":18,"tag":19,"props":1326,"children":1327},{},[1328],{"type":131,"value":1329},"CPU\u002FNPU发出mov指令后，本地MMU识别该地址为Memory，请求送到UB Decoder。UB Decoder查本地两级页表，得到{EID, TokenID, UBA_BASE, TokenValue}，把本地物理地址的低位拼到UBA_BASE上形成完整的UBA。随后UB Controller按当前一致性域、地址属性和传输配置封包；在典型LD-ST配置中，可使用一致性访问语义和TP Bypass等低开销路径。CPU\u002FNPU流水线阻塞等待响应，响应到达后数据写入寄存器，流水线解除阻塞。",{"type":18,"tag":19,"props":1331,"children":1332},{},[1333,1335,1341],{"type":131,"value":1334},"对应用而言，",{"type":18,"tag":590,"props":1336,"children":1338},{"className":1337},[],[1339],{"type":131,"value":1340},"int value = remote_ptr;",{"type":131,"value":1342},"这条C语句即可触发一次跨节点内存读。访问粒度可以细到单个Cache Line；实际延迟取决于拓扑距离、拥塞状态、表项命中率、一致性域配置以及具体芯片实现。",{"type":18,"tag":19,"props":1344,"children":1345},{},[1346],{"type":131,"value":1347},"两条路径共享同一套UMMU校验逻辑，但在发起侧走了不同的硬件路径。URMA依赖Jetty的SQ\u002FCQ管理，适合批量和异步场景；LD-ST依赖UB Decoder的地址反向翻译，适合细粒度和同步场景。它们不是替代关系，而是互补关系。AI训练中大多数场景是用URMA传梯度，用LD-ST读远端状态标志这样的混合使用。",{"type":18,"tag":144,"props":1349,"children":1351},{"id":1350},"_57-持续使用与权限回收",[1352],{"type":131,"value":1353},"5.7 持续使用与权限回收",{"type":18,"tag":19,"props":1355,"children":1356},{},[1357],{"type":131,"value":1358},"建立之后的持续访问成本极低。同一条UBMD可以被反复使用，每次访问无需重新建链。URMA只需重复post_send，LD-ST只需继续使用本地指针访问，硬件自动完成所有翻译、封包、校验。",{"type":18,"tag":19,"props":1360,"children":1361},{},[1362],{"type":131,"value":1363},"当协作结束，NPU B可以选择两种方式回收权限：完全撤销（urma_unregister_seg注销Segment，后续所有访问被拒绝）或者精细撤销（修改MAPTE的主\u002F备TokenValue，让特定用户的旧凭据失效而保留其他用户的访问）。精细撤销中主\u002F备TokenValue机制的价值充分显现：换锁芯而不销毁保险柜，无需通知其他用户，无需销毁内存段，完全在UMMU内部完成。",{"type":18,"tag":164,"props":1365,"children":1367},{"id":1366},"六软硬件协作的分工原则",[1368],{"type":131,"value":1369},"六、软硬件协作的分工原则",{"type":18,"tag":19,"props":1371,"children":1372},{},[1373,1375,1380],{"type":131,"value":1374},"回看整个流程，一个规律清晰浮现：",{"type":18,"tag":181,"props":1376,"children":1377},{},[1378],{"type":131,"value":1379},"控制平面软件主导，数据平面硬件主导",{"type":131,"value":1381},"。",{"type":18,"tag":19,"props":1383,"children":1384},{},[1385],{"type":131,"value":1386},"上电、UBFM枚举、CNA\u002FEID分配、路由下发、内存注册、TP Channel建立、Jetty创建、UB Decoder页表配置，这些建链相关动作大部分由软件（UBFM固件、OS驱动、应用库）主导，硬件被动响应（写寄存器、更新上下文表）。建链完成后，数据面的每次访问几乎完全由硬件自主完成：UB Controller封包，UMMU翻译和校验，DMA读写内存，CEG生成CQE。软件只负责提交请求和查询完成。",{"type":18,"tag":19,"props":1388,"children":1389},{},[1390],{"type":131,"value":1391},"这种分工不是偶然，而是基于一个根本的工程考量：建链次数少但逻辑复杂，交给软件更灵活；数据访问次数多但逻辑固定，交给硬件更高效。建链每个会话只做一次，涉及策略决策、资源协调、配置下发，用软件实现成本低、可迭代性强。数据访问每秒可能发生数百万次，延迟和吞吐都是关键指标，必须硬件化才能达到us级响应和TB级带宽。",{"type":18,"tag":19,"props":1393,"children":1394},{},[1395],{"type":131,"value":1396},"以一次典型的URMA Write为例，软件提供的仅仅是WQE里的几个字段：对端EID、TokenID、UBA、TokenValue、数据长度、操作码。其余所有包头字段都由硬件自主填入：SCNA来自寄存器读取，DCNA来自EID-CNA路由查询，SrcTPN\u002FDstTPN来自TPG调度器的选择，PSN来自TP Channel上下文的递增，CFG根据目标地址类型自动派生，LBF由硬件按负载均衡策略生成，ICRC由硬件流水计算。粗略估算，大约70%的包头字段由硬件自主产生，这正是UB能做到零CPU开销的根本原因。",{"type":18,"tag":19,"props":1398,"children":1399},{},[1400],{"type":131,"value":1401},"对LD-ST路径而言，CPU\u002FNPU的参与度更低。发出一条指令后就进入流水线阻塞，其余所有工作（本地物理地址到UBMD的翻译、封包、发送、接收响应、解除阻塞）都在硬件流水中完成。CPU\u002FNPU甚至不知道这是一块远端访问，它以为自己在等一次本地内存访问完成。",{"type":18,"tag":19,"props":1403,"children":1404},{},[1405],{"type":131,"value":1406},"这种分工模式让UB内存池化在应用层呈现两种接口形态：URMA面向异步批量传输，LD-ST面向同步细粒度访问。但底层是同一套硬件、同一套协议栈、同一套权限校验。",{"type":18,"tag":164,"props":1408,"children":1410},{"id":1409},"七两种访问模式的取舍",[1411],{"type":131,"value":1412},"七、两种访问模式的取舍",{"type":18,"tag":19,"props":1414,"children":1415},{},[1416],{"type":131,"value":1417},"URMA和LD-ST并非并列的两套协议，而是同一协议栈的两种使用方式。它们共享TAOpcode编码（Write都是0x03，Read都是0x06），共享UMMU的翻译与校验流程，但在发起侧的触发方式和完成管理上完全不同。",{"type":18,"tag":19,"props":1419,"children":1420},{},[1421],{"type":131,"value":1422},"URMA是异步编程模型，适合批量、大块、吞吐优先的场景。一次post_send可以提交一个GB级的传输请求，内部被切成大量TP Packet并发发送，硬件在后台完成所有传输，应用在合适的时机poll_cq查询结果。它的端到端延迟包含CPU提交、队列处理、网络传输和完成轮询开销，但吞吐更容易贴近链路上限。AI训练中的参数同步、Checkpoint保存、权重拉取、Pipeline激活值传递，都是URMA的典型舞台。",{"type":18,"tag":19,"props":1424,"children":1425},{},[1426],{"type":131,"value":1427},"LD-ST是同步编程模型，适合细粒度、低延迟、控制流场景，尤其适用融合算子这种极致性能优化场景（计算和通信细粒度pipeline）。一条mov或cmpxchg指令可以完成一次Cache Line级别的访问，语义更接近本地内存访问。原子操作可由硬件映射到对应Atomic事务，但具体ISA支持和一致性保证取决于处理器、UB Decoder配置和一致性域。此类访问通常不需要Jetty队列，可使用TP Bypass等低开销路径。分布式锁、远端状态查询、小控制字段更新、跨节点一致性维护，都是LD-ST适用的应用场景。",{"type":18,"tag":19,"props":1429,"children":1430},{},[1431],{"type":131,"value":1432},"在真实系统中两者往往混用。AI训练框架用URMA传梯度，用LD-ST读远端的同步标志位；MoE推理用LD-ST访问远端专家的路由表，用URMA批量回传中间激活值；分布式KV Cache用LD-ST查询元信息，用URMA搬运数据主体。这种混合使用体现了UB的接口分层价值：同一套底层协议和标识符体系，可以按场景选择不同访问路径。",{"type":18,"tag":19,"props":1434,"children":1435},{},[1436],{"type":131,"value":1437},"LD-ST适合细粒度同步访问，URMA则保留了异步模型在大块传输场景下的吞吐优势。LD-ST每次访问都让CPU\u002FNPU流水线阻塞等待RTT，对于传输1 GB数据这样的任务，阻塞上百万个RTT时间并不经济。URMA允许应用一次提交后让CPU\u002FNPU继续处理其他工作，DMA引擎在后台并发传输。两种模式各自覆盖不同访问需求，共同构成完整的访问能力谱系。",{"type":18,"tag":387,"props":1439,"children":1440},{"style":389},[1441,1449],{"type":18,"tag":19,"props":1442,"children":1443},{},[1444],{"type":18,"tag":23,"props":1445,"children":1448},{"alt":1446,"src":1447},"图8","\u002Fcategory\u002Fnews\u002Flarge-scale-ai-cluster-memory-access-mechanism-technology\u002Ffig8-urma-ld-st-matrix.png",[],{"type":18,"tag":19,"props":1450,"children":1451},{},[1452],{"type":18,"tag":403,"props":1453,"children":1454},{"style":405},[1455],{"type":131,"value":1456},"图8 URMA与LD-ST选择矩阵",{"type":18,"tag":19,"props":1458,"children":1459},{},[1460],{"type":131,"value":1461},"表3对比了URMA与LD-ST在触发方式、粒度、延迟和场景上的差异。",{"type":18,"tag":223,"props":1463,"children":1464},{},[1465,1486],{"type":18,"tag":227,"props":1466,"children":1467},{},[1468],{"type":18,"tag":231,"props":1469,"children":1470},{},[1471,1476,1481],{"type":18,"tag":235,"props":1472,"children":1473},{},[1474],{"type":131,"value":1475},"维度",{"type":18,"tag":235,"props":1477,"children":1478},{},[1479],{"type":131,"value":1480},"URMA异步模式",{"type":18,"tag":235,"props":1482,"children":1483},{},[1484],{"type":131,"value":1485},"LD-ST同步模式",{"type":18,"tag":251,"props":1487,"children":1488},{},[1489,1507,1525,1543,1561,1579,1597,1615,1633,1651],{"type":18,"tag":231,"props":1490,"children":1491},{},[1492,1497,1502],{"type":18,"tag":258,"props":1493,"children":1494},{},[1495],{"type":131,"value":1496},"触发方式",{"type":18,"tag":258,"props":1498,"children":1499},{},[1500],{"type":131,"value":1501},"API（post_send \u002F poll_cq）",{"type":18,"tag":258,"props":1503,"children":1504},{},[1505],{"type":131,"value":1506},"CPU指令（mov \u002F cmpxchg）",{"type":18,"tag":231,"props":1508,"children":1509},{},[1510,1515,1520],{"type":18,"tag":258,"props":1511,"children":1512},{},[1513],{"type":131,"value":1514},"访问粒度",{"type":18,"tag":258,"props":1516,"children":1517},{},[1518],{"type":131,"value":1519},"KB-GB批量",{"type":18,"tag":258,"props":1521,"children":1522},{},[1523],{"type":131,"value":1524},"Cache Line（64B）级",{"type":18,"tag":231,"props":1526,"children":1527},{},[1528,1533,1538],{"type":18,"tag":258,"props":1529,"children":1530},{},[1531],{"type":131,"value":1532},"访问延迟",{"type":18,"tag":258,"props":1534,"children":1535},{},[1536],{"type":131,"value":1537},"包含提交\u002F轮询开销，通常高于单次同步访问",{"type":18,"tag":258,"props":1539,"children":1540},{},[1541],{"type":131,"value":1542},"取决于拓扑、拥塞、表项命中和一致性域配置",{"type":18,"tag":231,"props":1544,"children":1545},{},[1546,1551,1556],{"type":18,"tag":258,"props":1547,"children":1548},{},[1549],{"type":131,"value":1550},"吞吐能力",{"type":18,"tag":258,"props":1552,"children":1553},{},[1554],{"type":131,"value":1555},"可打满链路带宽",{"type":18,"tag":258,"props":1557,"children":1558},{},[1559],{"type":131,"value":1560},"受单颗RTT限制",{"type":18,"tag":231,"props":1562,"children":1563},{},[1564,1569,1574],{"type":18,"tag":258,"props":1565,"children":1566},{},[1567],{"type":131,"value":1568},"CPU参与度",{"type":18,"tag":258,"props":1570,"children":1571},{},[1572],{"type":131,"value":1573},"post\u002Fpoll需要参与",{"type":18,"tag":258,"props":1575,"children":1576},{},[1577],{"type":131,"value":1578},"仅发指令，硬件阻塞\u002F硬件响应",{"type":18,"tag":231,"props":1580,"children":1581},{},[1582,1587,1592],{"type":18,"tag":258,"props":1583,"children":1584},{},[1585],{"type":131,"value":1586},"缓存一致性",{"type":18,"tag":258,"props":1588,"children":1589},{},[1590],{"type":131,"value":1591},"通常不参与",{"type":18,"tag":258,"props":1593,"children":1594},{},[1595],{"type":131,"value":1596},"可参与，取决于一致性域与地址属性配置",{"type":18,"tag":231,"props":1598,"children":1599},{},[1600,1605,1610],{"type":18,"tag":258,"props":1601,"children":1602},{},[1603],{"type":131,"value":1604},"原子操作",{"type":18,"tag":258,"props":1606,"children":1607},{},[1608],{"type":131,"value":1609},"协议级Atomic事务",{"type":18,"tag":258,"props":1611,"children":1612},{},[1613],{"type":131,"value":1614},"可映射到处理器支持的原子语义",{"type":18,"tag":231,"props":1616,"children":1617},{},[1618,1623,1628],{"type":18,"tag":258,"props":1619,"children":1620},{},[1621],{"type":131,"value":1622},"是否用Jetty",{"type":18,"tag":258,"props":1624,"children":1625},{},[1626],{"type":131,"value":1627},"是",{"type":18,"tag":258,"props":1629,"children":1630},{},[1631],{"type":131,"value":1632},"否",{"type":18,"tag":231,"props":1634,"children":1635},{},[1636,1641,1646],{"type":18,"tag":258,"props":1637,"children":1638},{},[1639],{"type":131,"value":1640},"传输层模式",{"type":18,"tag":258,"props":1642,"children":1643},{},[1644],{"type":131,"value":1645},"RTP \u002F CTP（含PSN重传）",{"type":18,"tag":258,"props":1647,"children":1648},{},[1649],{"type":131,"value":1650},"常用TP Bypass等低开销路径",{"type":18,"tag":231,"props":1652,"children":1653},{},[1654,1659,1664],{"type":18,"tag":258,"props":1655,"children":1656},{},[1657],{"type":131,"value":1658},"适用场景",{"type":18,"tag":258,"props":1660,"children":1661},{},[1662],{"type":131,"value":1663},"梯度同步、Checkpoint、权重拉取",{"type":18,"tag":258,"props":1665,"children":1666},{},[1667],{"type":131,"value":1668},"分布式锁、状态查询、小字段更新",{"type":18,"tag":164,"props":1670,"children":1672},{"id":1671},"八ai负载中的价值显现",[1673],{"type":131,"value":1674},"八、AI负载中的价值显现",{"type":18,"tag":19,"props":1676,"children":1677},{},[1678],{"type":131,"value":1679},"内存池化不是展板上的技术名词，而是解决具体工程问题的手段。几个典型的受益场景可以说明它的实战价值。",{"type":18,"tag":19,"props":1681,"children":1682},{},[1683,1688],{"type":18,"tag":181,"props":1684,"children":1685},{},[1686],{"type":131,"value":1687},"MoE大模型推理中的专家访问。",{"type":131,"value":1689}," DeepSeek V4这类模型有数百个专家，一次token路由可能激活其中若干个。传统方案下专家权重分散在不同节点，每次路由往往需要显式的Dispatch\u002FCombine通信。UB内存池化下，专家权重可以暴露为全局内存段，计算节点有机会通过LD-ST直接读取所需专家权重，从而减少显式通信和调度开销。具体延迟收益取决于专家放置、拓扑距离、访问粒度和缓存命中情况。",{"type":18,"tag":19,"props":1691,"children":1692},{},[1693,1698],{"type":18,"tag":181,"props":1694,"children":1695},{},[1696],{"type":131,"value":1697},"KV Cache的动态池化。",{"type":131,"value":1699}," 百万token上下文下的KV Cache可能占几十GB。不同请求之间的负载极不均衡。传统方案中，单请求超出本卡HBM上限只能拒绝或截断；UB内存池化允许KV Cache分散在整个集群内存池中，让内存紧张的节点按需使用其他节点的空闲HBM。它的价值在于提高可调度空间和削峰能力，实际利用率提升幅度需要结合负载分布、调度策略和远端访问比例评估。",{"type":18,"tag":19,"props":1701,"children":1702},{},[1703,1708],{"type":18,"tag":181,"props":1704,"children":1705},{},[1706],{"type":131,"value":1707},"参数服务器架构的重新评估。",{"type":131,"value":1709}," 经典PS架构在大模型训练场景中因为CPU处理瓶颈逐渐被AllReduce替代（推荐系统等场景仍在使用）。UB内存池化让PS在大模型训练中重新具备讨论空间：PS节点把权重暴露为全局内存段，Worker直接用LD-ST或URMA拉取权重，PS的CPU完全不介入数据面。PS的灵活性（异构Worker、动态调度）和AllReduce的性能（零CPU介入）第一次可以兼得。",{"type":18,"tag":19,"props":1711,"children":1712},{},[1713,1718],{"type":18,"tag":181,"props":1714,"children":1715},{},[1716],{"type":131,"value":1717},"训练中的低干扰Checkpoint。",{"type":131,"value":1719}," Checkpoint曾是训练中CPU与IO的共同瓶颈，每次保存可能占用数秒到数十秒的计算时间。UB内存池化下，Checkpoint可以通过URMA异步写入专用存储节点的共享内存，使计算与存储更充分并行。最终吞吐损失取决于Checkpoint频率、写入带宽、存储节点能力和后台传输调度。",{"type":18,"tag":19,"props":1721,"children":1722},{},[1723],{"type":131,"value":1724},"这些场景的共同点是：它们都不是UB发明的需求，而是AI工程师一直面对的痛点。UB通过提供统一的内存访问基础设施，让这些痛点有了系统性的解决方案，而不是让每个团队各自打补丁。基础设施的价值，往往体现在它把复杂的跨节点协作转化为可复用的系统能力。",{"type":18,"tag":164,"props":1726,"children":1728},{"id":1727},"结语从远程搬运到统一内存访问",[1729],{"type":131,"value":1730},"结语：从远程搬运到统一内存访问",{"type":18,"tag":19,"props":1732,"children":1733},{},[1734],{"type":131,"value":1735},"过去二十年，分布式计算的演进方向一直是让多台机器更好地协作。局部高速互联、跨卡内存扩展和跨机数据传输分别解决了不同层面的问题。面向8192卡尺度的AI集群，内存系统还需要同时具备全局地址组织、硬件级权限校验、低开销访问路径和可扩展管理能力。",{"type":18,"tag":19,"props":1737,"children":1738},{},[1739],{"type":131,"value":1740},"UB内存池化走到了这个交叉点上。它通过UB Controller、UMMU、UB Decoder、UB Switch、UBFM的端到端协同，让超节点规模的所有HBM第一次以统一的地址空间、统一的访问语义呈现给软件。对AI应用开发者而言，这意味着数据在哪里从架构设计一等公民变成运行时绑定部署细节。",{"type":18,"tag":19,"props":1742,"children":1743},{},[1744],{"type":131,"value":1745},"这不只是性能优化，更是编程模型的变化。当一个8192卡集群能够以统一地址和统一访问语义暴露给软件，分布式协作就可以从应用显式编排，逐步转移为基础设施默认提供的能力。",{"type":18,"tag":19,"props":1747,"children":1748},{},[1749],{"type":131,"value":1750},"推理模型把计算从秒级拉到分钟级，Agent把单次任务的状态从MB拉到GB，多模态把显存消耗推向另一个数量级。DeepSeek V4这一代模型对内存系统的要求，早已超出了单卡更大HBM能解决的范围。整个行业需要的是一次从远程数据访问到统一内存访问的范式变化。",{"type":18,"tag":19,"props":1752,"children":1753},{},[1754],{"type":131,"value":1755},"UB内存池化的意义，在于把跨节点内存访问从应用显式搬运转向基础设施级访问语义。这是一种从局部优化到机制重构的变化，也是UB作为下一代互联协议的重要技术价值。",{"type":18,"tag":164,"props":1757,"children":1759},{"id":1758},"参考资料",[1760],{"type":131,"value":1758},{"type":18,"tag":605,"props":1762,"children":1763},{},[1764,1769,1774,1779],{"type":18,"tag":609,"props":1765,"children":1766},{},[1767],{"type":131,"value":1768},"UB Base Specification 2.0.1",{"type":18,"tag":609,"props":1770,"children":1771},{},[1772],{"type":131,"value":1773},"UB Firmware Specification 2.0",{"type":18,"tag":609,"props":1775,"children":1776},{},[1777],{"type":131,"value":1778},"UB Software Reference Design for OS 2.0",{"type":18,"tag":609,"props":1780,"children":1781},{},[1782],{"type":131,"value":1783},"UB SuperPOD Architecture White Paper",{"type":18,"tag":1785,"props":1786,"children":1787},"style",{},[1788],{"type":131,"value":1789},"html .default .shiki span {color: var(--shiki-default);background: var(--shiki-default-bg);font-style: var(--shiki-default-font-style);font-weight: var(--shiki-default-font-weight);text-decoration: var(--shiki-default-text-decoration);}html .shiki span {color: var(--shiki-default);background: var(--shiki-default-bg);font-style: var(--shiki-default-font-style);font-weight: var(--shiki-default-font-weight);text-decoration: var(--shiki-default-text-decoration);}html .dark .shiki span {color: var(--shiki-dark);background: var(--shiki-dark-bg);font-style: var(--shiki-dark-font-style);font-weight: var(--shiki-dark-font-weight);text-decoration: var(--shiki-dark-text-decoration);}html.dark .shiki span {color: var(--shiki-dark);background: var(--shiki-dark-bg);font-style: var(--shiki-dark-font-style);font-weight: var(--shiki-dark-font-weight);text-decoration: var(--shiki-dark-text-decoration);}html .sepia .shiki span {color: var(--shiki-sepia);background: var(--shiki-sepia-bg);font-style: var(--shiki-sepia-font-style);font-weight: var(--shiki-sepia-font-weight);text-decoration: var(--shiki-sepia-text-decoration);}html.sepia .shiki span {color: var(--shiki-sepia);background: var(--shiki-sepia-bg);font-style: var(--shiki-sepia-font-style);font-weight: var(--shiki-sepia-font-weight);text-decoration: var(--shiki-sepia-text-decoration);}",{"title":8,"searchDepth":28,"depth":28,"links":1791},[1792,1793,1794,1795,1796,1797,1798,1799,1800,1801,1802,1803,1804,1805],{"id":146,"depth":988,"text":146},{"id":377,"depth":988,"text":380},{"id":426,"depth":988,"text":429},{"id":456,"depth":988,"text":459},{"id":573,"depth":988,"text":576},{"id":661,"depth":988,"text":664},{"id":729,"depth":988,"text":732},{"id":911,"depth":988,"text":914},{"id":927,"depth":988,"text":930},{"id":958,"depth":988,"text":961},{"id":1056,"depth":988,"text":1059},{"id":1091,"depth":988,"text":1094},{"id":1124,"depth":988,"text":1127},{"id":1350,"depth":988,"text":1353},"content:zh:news:large-scale-ai-cluster-memory-access-mechanism-technology.md","zh\u002Fnews\u002Flarge-scale-ai-cluster-memory-access-mechanism-technology.md","zh\u002Fnews\u002Flarge-scale-ai-cluster-memory-access-mechanism-technology",{"_path":1810,"_dir":6,"_draft":7,"_partial":7,"_locale":8,"title":1811,"description":10,"date":119,"cover":1812,"type":13,"body":1813,"_type":30,"_id":1824,"_source":32,"_file":1825,"_stem":1826,"_extension":35},"\u002Fzh\u002Fnews\u002Flive-public-class52","灵衢协议解码公开课-传输层解读","\u002Fcategory\u002Fnews\u002Flive-public-class\u002Flive-public-class52-cover.jpg",{"type":15,"children":1814,"toc":1822},[1815],{"type":18,"tag":19,"props":1816,"children":1817},{},[1818],{"type":18,"tag":23,"props":1819,"children":1821},{"alt":107,"src":1820},"\u002Fcategory\u002Fnews\u002Flive-public-class\u002Flive-public-class52.jpg",[],{"title":8,"searchDepth":28,"depth":28,"links":1823},[],"content:zh:news:live-public-class52.md","zh\u002Fnews\u002Flive-public-class52.md","zh\u002Fnews\u002Flive-public-class52",{"_path":1828,"_dir":6,"_draft":7,"_partial":7,"_locale":8,"title":1829,"description":1830,"date":119,"cover":1831,"type":13,"body":1832,"_type":30,"_id":2003,"_source":32,"_file":2004,"_stem":2005,"_extension":35},"\u002Fzh\u002Fnews\u002Freview-of-the-second-preparatory-meeting","灵衢开发与场景实践论坛暨灵衢互联社区第二次筹备会议回顾","2026年5月23日，灵衢开发与场景实践论坛暨灵衢互联社区第二次筹备会议在北京成功召开。","\u002Fcategory\u002Fnews\u002Freview-of-the-second-preparatory-meeting\u002Fcover.jpg",{"type":15,"children":1833,"toc":2001},[1834,1843,1847,1865,1870,1889,1894,1899,1917,1922,1940,1945,1963,1968,1986,1991,1996],{"type":18,"tag":19,"props":1835,"children":1836},{},[1837],{"type":18,"tag":1838,"props":1839,"children":1842},"video",{"src":1840,"poster":8,"controls":1841,"muted":1841},"https:\u002F\u002Fcdn.unifiedbus.com\u002Fvideo\u002Freview-of-the-second-preparatory-meeting.mp4",true,[],{"type":18,"tag":19,"props":1844,"children":1845},{},[1846],{"type":131,"value":1830},{"type":18,"tag":387,"props":1848,"children":1849},{"style":389},[1850,1857],{"type":18,"tag":19,"props":1851,"children":1852},{},[1853],{"type":18,"tag":23,"props":1854,"children":1856},{"alt":396,"src":1855},"\u002Fcategory\u002Fnews\u002Freview-of-the-second-preparatory-meeting\u002Fimage1.jpeg",[],{"type":18,"tag":19,"props":1858,"children":1859},{},[1860],{"type":18,"tag":403,"props":1861,"children":1862},{"style":405},[1863],{"type":131,"value":1864},"【图：会议现场全景】",{"type":18,"tag":19,"props":1866,"children":1867},{},[1868],{"type":131,"value":1869},"本次会议在鲲鹏昇腾开发者大会2026（KADC）期间举行，聚焦灵衢互联技术的开发进展、标准规划、仿真验证及AI推理场景下的关键应用，来自产业界、学术界的多位技术专家与开发者代表现场参会。会议旨在加速灵衢技术从架构创新走向场景落地，并再次向全球开发者发出开放共建的邀请。",{"type":18,"tag":387,"props":1871,"children":1872},{"style":389},[1873,1881],{"type":18,"tag":19,"props":1874,"children":1875},{},[1876],{"type":18,"tag":23,"props":1877,"children":1880},{"alt":1878,"src":1879},"image","\u002Fcategory\u002Fnews\u002Freview-of-the-second-preparatory-meeting\u002Fimage2.jpeg",[],{"type":18,"tag":19,"props":1882,"children":1883},{},[1884],{"type":18,"tag":403,"props":1885,"children":1886},{"style":405},[1887],{"type":131,"value":1888},"【图：华为计算研发副总裁龙盘致辞】",{"type":18,"tag":19,"props":1890,"children":1891},{},[1892],{"type":131,"value":1893},"华为计算研发副总裁龙盘在致辞中指出，人工智能正迈入人机协同作业的全新阶段，智能体逐步具备自主任务执行能力。灵衢依托统一内存编址、高带宽低时延互联等核心能力，实现计算架构模式革新，可充分适配大模型预训练、AI 推理等智算场景，同时也为通用计算领域突破性能瓶颈、跳出硬件迭代局限创造全新机遇，实测落地后系统性能与响应时延均实现显著优化。",{"type":18,"tag":19,"props":1895,"children":1896},{},[1897],{"type":131,"value":1898},"龙盘表示，当前灵衢技术生态稳步开放发展，累计来自26个国家超过3万个企业级用户已下载UB2.0 技术规范，结合行业反馈完成版本迭代升级。软硬件层面同步推进开源共建，硬件可支撑定制化超节点搭建，相关操作系统组件也已开源上线。",{"type":18,"tag":387,"props":1900,"children":1901},{"style":389},[1902,1909],{"type":18,"tag":19,"props":1903,"children":1904},{},[1905],{"type":18,"tag":23,"props":1906,"children":1908},{"alt":1878,"src":1907},"\u002Fcategory\u002Fnews\u002Freview-of-the-second-preparatory-meeting\u002Fimage3.jpeg",[],{"type":18,"tag":19,"props":1910,"children":1911},{},[1912],{"type":18,"tag":403,"props":1913,"children":1914},{"style":405},[1915],{"type":131,"value":1916},"【图：华为计算标准专利部长梁冰演讲】",{"type":18,"tag":19,"props":1918,"children":1919},{},[1920],{"type":131,"value":1921},"华为计算标准专利部长梁冰带来“灵衢互联社区进展与规划”主题分享。她系统介绍了社区在标准组织、代码贡献、开发者支持等方面的最新布局。梁冰透露，社区已启动协议工作组、互联互通验证工作组等多个专项小组，并计划在仿真验证、参考设计、应用案例征集等方面持续投入资源。",{"type":18,"tag":387,"props":1923,"children":1924},{"style":389},[1925,1932],{"type":18,"tag":19,"props":1926,"children":1927},{},[1928],{"type":18,"tag":23,"props":1929,"children":1931},{"alt":1878,"src":1930},"\u002Fcategory\u002Fnews\u002Freview-of-the-second-preparatory-meeting\u002Fimage4.jpeg",[],{"type":18,"tag":19,"props":1933,"children":1934},{},[1935],{"type":18,"tag":403,"props":1936,"children":1937},{"style":405},[1938],{"type":131,"value":1939},"【图：灵衢协议标准专家张亚丽发言】",{"type":18,"tag":19,"props":1941,"children":1942},{},[1943],{"type":131,"value":1944},"灵衢协议标准专家张亚丽详细解读了灵衢协议的最新规划与发展方向。她表示，灵衢协议已形成覆盖物理层至事务层的全栈规范，核心特征包括总线级互联、多端口聚合、统一编址等。张亚丽指出，灵衢协议工作组已向全行业开放，欢迎有意愿的开发者、厂商参与标准制定与优化。",{"type":18,"tag":387,"props":1946,"children":1947},{"style":389},[1948,1955],{"type":18,"tag":19,"props":1949,"children":1950},{},[1951],{"type":18,"tag":23,"props":1952,"children":1954},{"alt":1878,"src":1953},"\u002Fcategory\u002Fnews\u002Freview-of-the-second-preparatory-meeting\u002Fimage5.jpeg",[],{"type":18,"tag":19,"props":1956,"children":1957},{},[1958],{"type":18,"tag":403,"props":1959,"children":1960},{"style":405},[1961],{"type":131,"value":1962},"【图：灵衢互联社区仿真验证环境专家霍平弋演讲】",{"type":18,"tag":19,"props":1964,"children":1965},{},[1966],{"type":131,"value":1967},"为帮助开发者快速上手，灵衢互联社区计算系统仿真评估专家霍平弋介绍了社区提供的仿真验证环境。该环境支持基于灵衢协议的内存直访语义模拟，开发者可在真实部署前进行架构验证与性能评估。",{"type":18,"tag":387,"props":1969,"children":1970},{"style":389},[1971,1978],{"type":18,"tag":19,"props":1972,"children":1973},{},[1974],{"type":18,"tag":23,"props":1975,"children":1977},{"alt":1878,"src":1976},"\u002Fcategory\u002Fnews\u002Freview-of-the-second-preparatory-meeting\u002Fimage6.jpeg",[],{"type":18,"tag":19,"props":1979,"children":1980},{},[1981],{"type":18,"tag":403,"props":1982,"children":1983},{"style":405},[1984],{"type":131,"value":1985},"【图：灵衢技术规划专家李铮演讲】",{"type":18,"tag":19,"props":1987,"children":1988},{},[1989],{"type":131,"value":1990},"在AI推理成为企业关注重点的背景下，灵衢技术规划专家李铮带来“灵衢UB如何支撑KV Cache”的深度解读。他指出，KV Cache本质上是一个访存性能问题，通过“以存代算”的思路可大幅提升推理效率。基于灵衢UB的平等互联架构，可将单一请求的KVCache拆分至多节点的GPU显存或CPU内存中，通过高速网络实现实时访问，有效突破“单卡独占”的瓶颈。实测数据显示，灵衢UB方案可使推理时延降低约40%，为长序列推理任务提供了全新优化路径。",{"type":18,"tag":19,"props":1992,"children":1993},{},[1994],{"type":131,"value":1995},"灵衢不是某一家的产品，而是全球开发者共同的平台。社区诚邀各方力量加入标准制定、方案验证、场景落地等环节，共同推动灵衢技术不断成长与迭代。",{"type":18,"tag":19,"props":1997,"children":1998},{},[1999],{"type":131,"value":2000},"灵衢互联社区，期待您的加入。",{"title":8,"searchDepth":28,"depth":28,"links":2002},[],"content:zh:news:review-of-the-second-preparatory-meeting.md","zh\u002Fnews\u002Freview-of-the-second-preparatory-meeting.md","zh\u002Fnews\u002Freview-of-the-second-preparatory-meeting",{"_path":2007,"_dir":6,"_draft":7,"_partial":7,"_locale":8,"title":2008,"description":10,"date":2009,"cover":2010,"type":13,"body":2011,"_type":30,"_id":2022,"_source":32,"_file":2023,"_stem":2024,"_extension":35},"\u002Fzh\u002Fnews\u002Fdevelopment-and-scenario-practice","灵衢开发与场景实践论坛暨灵衢互联社区第二次筹备会议","2026\u002F05\u002F23 10:00","\u002Fcategory\u002Fnews\u002Fdevelopment-and-scenario-practice-cover.jpg",{"type":15,"children":2012,"toc":2020},[2013],{"type":18,"tag":19,"props":2014,"children":2015},{},[2016],{"type":18,"tag":23,"props":2017,"children":2019},{"alt":107,"src":2018},"\u002Fcategory\u002Fnews\u002Fdevelopment-and-scenario-practice.jpg",[],{"title":8,"searchDepth":28,"depth":28,"links":2021},[],"content:zh:news:development-and-scenario-practice.md","zh\u002Fnews\u002Fdevelopment-and-scenario-practice.md","zh\u002Fnews\u002Fdevelopment-and-scenario-practice",{"_path":2026,"_dir":6,"_draft":7,"_partial":7,"_locale":8,"title":2027,"description":10,"date":2028,"cover":2029,"type":13,"body":2030,"_type":30,"_id":2041,"_source":32,"_file":2042,"_stem":2043,"_extension":35},"\u002Fzh\u002Fnews\u002Flive-public-class5","灵衢协议解码公开课-网络层解读","2026\u002F05\u002F19 18:00","\u002Fcategory\u002Fnews\u002Flive-public-class\u002Flive-public-class5-cover.jpg",{"type":15,"children":2031,"toc":2039},[2032],{"type":18,"tag":19,"props":2033,"children":2034},{},[2035],{"type":18,"tag":23,"props":2036,"children":2038},{"alt":107,"src":2037},"\u002Fcategory\u002Fnews\u002Flive-public-class\u002Flive-public-class5.jpg",[],{"title":8,"searchDepth":28,"depth":28,"links":2040},[],"content:zh:news:live-public-class5.md","zh\u002Fnews\u002Flive-public-class5.md","zh\u002Fnews\u002Flive-public-class5",{"_path":2045,"_dir":6,"_draft":7,"_partial":7,"_locale":8,"title":2046,"description":10,"date":2047,"cover":2048,"type":13,"body":2049,"_type":30,"_id":2060,"_source":32,"_file":2061,"_stem":2062,"_extension":35},"\u002Fzh\u002Fnews\u002Flive-public-class4","灵衢协议解码公开课-数据链路层解读","2026\u002F05\u002F14 18:00","\u002Fcategory\u002Fnews\u002Flive-public-class\u002Flive-public-class4-cover.jpg",{"type":15,"children":2050,"toc":2058},[2051],{"type":18,"tag":19,"props":2052,"children":2053},{},[2054],{"type":18,"tag":23,"props":2055,"children":2057},{"alt":107,"src":2056},"\u002Fcategory\u002Fnews\u002Flive-public-class\u002Flive-public-class4.jpg",[],{"title":8,"searchDepth":28,"depth":28,"links":2059},[],"content:zh:news:live-public-class4.md","zh\u002Fnews\u002Flive-public-class4.md","zh\u002Fnews\u002Flive-public-class4",{"_path":2064,"_dir":6,"_draft":7,"_partial":7,"_locale":8,"title":2065,"description":10,"date":2066,"cover":2067,"type":13,"body":2068,"_type":30,"_id":2079,"_source":32,"_file":2080,"_stem":2081,"_extension":35},"\u002Fzh\u002Fnews\u002Flive-public-class3","灵衢协议解码公开课-物理层解读","2026\u002F05\u002F08 18:00","\u002Fcategory\u002Fnews\u002Flive-public-class\u002Flive-public-class3-cover.jpg",{"type":15,"children":2069,"toc":2077},[2070],{"type":18,"tag":19,"props":2071,"children":2072},{},[2073],{"type":18,"tag":23,"props":2074,"children":2076},{"alt":107,"src":2075},"\u002Fcategory\u002Fnews\u002Flive-public-class\u002Flive-public-class3.jpg",[],{"title":8,"searchDepth":28,"depth":28,"links":2078},[],"content:zh:news:live-public-class3.md","zh\u002Fnews\u002Flive-public-class3.md","zh\u002Fnews\u002Flive-public-class3",{"_path":2083,"_dir":6,"_draft":7,"_partial":7,"_locale":8,"title":2084,"description":10,"date":2085,"cover":2086,"type":13,"body":2087,"_type":30,"_id":2098,"_source":32,"_file":2099,"_stem":2100,"_extension":35},"\u002Fzh\u002Fnews\u002Flive-public-class2","灵衢系统软件架构&部署公开课，开放预约","2026\u002F04\u002F28 18:00","\u002Fcategory\u002Fnews\u002Flive-public-class\u002Flive-public-class2-cover.jpg",{"type":15,"children":2088,"toc":2096},[2089],{"type":18,"tag":19,"props":2090,"children":2091},{},[2092],{"type":18,"tag":23,"props":2093,"children":2095},{"alt":107,"src":2094},"\u002Fcategory\u002Fnews\u002Flive-public-class\u002Flive-public-class2.jpg",[],{"title":8,"searchDepth":28,"depth":28,"links":2097},[],"content:zh:news:live-public-class2.md","zh\u002Fnews\u002Flive-public-class2.md","zh\u002Fnews\u002Flive-public-class2",{"_path":2102,"_dir":6,"_draft":7,"_partial":7,"_locale":8,"title":2103,"description":10,"date":2104,"cover":2105,"type":13,"body":2106,"_type":30,"_id":2117,"_source":32,"_file":2118,"_stem":2119,"_extension":35},"\u002Fzh\u002Fnews\u002Flive-public-class1","灵衢协议解码公开课，正式开课","2026\u002F04\u002F23 12:00","\u002Fcategory\u002Fnews\u002Flive-public-class\u002Flive-public-class1-cover.jpg",{"type":15,"children":2107,"toc":2115},[2108],{"type":18,"tag":19,"props":2109,"children":2110},{},[2111],{"type":18,"tag":23,"props":2112,"children":2114},{"alt":107,"src":2113},"\u002Fcategory\u002Fnews\u002Flive-public-class\u002Flive-public-class1.jpg",[],{"title":8,"searchDepth":28,"depth":28,"links":2116},[],"content:zh:news:live-public-class1.md","zh\u002Fnews\u002Flive-public-class1.md","zh\u002Fnews\u002Flive-public-class1",{"_path":2121,"_dir":6,"_draft":7,"_partial":7,"_locale":8,"title":2122,"description":10,"date":2123,"cover":2124,"type":6,"body":2125,"_type":30,"_id":2261,"_source":32,"_file":2262,"_stem":2263,"_extension":35},"\u002Fzh\u002Fnews\u002FUB-protocol-ipInteroperability-verification","牛芯半导体完成UB协议IP互通验证","2026\u002F03\u002F20 17:30","\u002Fcategory\u002Fnews\u002FUB-protocol-ipInteroperability-verification\u002Fcover.png",{"type":15,"children":2126,"toc":2259},[2127,2132,2151,2161,2166,2171,2176,2185,2190,2195,2215,2220,2238,2246],{"type":18,"tag":19,"props":2128,"children":2129},{},[2130],{"type":131,"value":2131},"近日，牛芯半导体在UB协议IP研发上取得重要进展：搭载自研控制器IP的原型验证平台，与深圳市万里眼技术有限公司的标准UB网络测试仪完成对接，这一进展标志着牛芯半导体自研UB控制器IP在协议一致性上迈出关键一步。",{"type":18,"tag":387,"props":2133,"children":2135},{"style":2134},"text-align: center;margin-top:24px;",[2136,2143],{"type":18,"tag":19,"props":2137,"children":2138},{},[2139],{"type":18,"tag":23,"props":2140,"children":2142},{"alt":107,"src":2141},"\u002Fcategory\u002Fnews\u002FUB-protocol-ipInteroperability-verification\u002Fimg1.png",[],{"type":18,"tag":19,"props":2144,"children":2145},{},[2146],{"type":18,"tag":403,"props":2147,"children":2148},{"style":405},[2149],{"type":131,"value":2150},"图1：牛芯自研控制器IP成功对接万里眼UB网络测试仪",{"type":18,"tag":387,"props":2152,"children":2154},{"style":2153},"text-align: left;",[2155],{"type":18,"tag":164,"props":2156,"children":2158},{"id":2157},"ub协议面向超节点互联的新一代协议",[2159],{"type":131,"value":2160},"UB协议：面向超节点互联的新一代协议",{"type":18,"tag":19,"props":2162,"children":2163},{},[2164],{"type":131,"value":2165},"随着AI模型参数规模从千亿迈向万亿，单机训练已难以支撑，数以万计的算力需要高效协同。在此背景下，由华为发起的UB（UnifiedBus，中文名“灵衢”）协议应运而生——它在芯片间实现总线级超低延迟与高带宽的同时，具备集群级的大规模扩展能力，为构建高效协同的算力基础设施提供了全新路径。",{"type":18,"tag":19,"props":2167,"children":2168},{},[2169],{"type":131,"value":2170},"UB协议的价值在于实现算力资源的池化与解耦——让CPU、GPU、NPU、内存、存储等异构计算单元突破物理边界，像访问本地资源一样高效调用远端资源，从而充分释放集群整体算力潜力。",{"type":18,"tag":19,"props":2172,"children":2173},{},[2174],{"type":131,"value":2175},"牛芯半导体是国内最早布局UB协议的企业之一。其自主研发的PHY IP与控制器IP，覆盖从物理层、数据链路层到事务层的全协议栈，是将UB协议从标准规范落地为可量产硅片的核心桥梁。",{"type":18,"tag":387,"props":2177,"children":2178},{"style":2153},[2179],{"type":18,"tag":164,"props":2180,"children":2182},{"id":2181},"技术突破自研ip完成协议层互通验证",[2183],{"type":131,"value":2184},"技术突破：自研IP完成协议层互通验证",{"type":18,"tag":19,"props":2186,"children":2187},{},[2188],{"type":131,"value":2189},"牛芯半导体基于自研控制器IP，与万里眼标准UB网络测试仪完成对接，符合标准协议要求。该控制器IP支持同步内存访问与异步通信双重语义，可在业务不中断的情况下实现链路带宽的动态切换，支持多种FEC模式切换，并提供IP Lane数量、速率等关键规格的灵活配置。在流控管理方面，其采用基于Credit的机制，高效支持多个虚通道及其缓存共享。在可靠性方面，其通过数据链路层的CRC保护与错误重传机制，为数据传输提供稳固保障。",{"type":18,"tag":19,"props":2191,"children":2192},{},[2193],{"type":131,"value":2194},"验证遵循UB2.0协议规范，覆盖物理编码子层和链路层协商功能。经万里眼标准UB网络测试仪一致性验证，链路建立稳定，数据传输准确，底层协议实现与规范要求高度一致，为后续与更多生态伙伴的互操作测试奠定了坚实基础。",{"type":18,"tag":387,"props":2196,"children":2198},{"style":2197},"text-align: center;margin-bottom:24px;margin-top:24px;display:inline-block",[2199,2207],{"type":18,"tag":19,"props":2200,"children":2201},{},[2202],{"type":18,"tag":23,"props":2203,"children":2206},{"alt":2204,"src":2205},"img2","\u002Fcategory\u002Fnews\u002FUB-protocol-ipInteroperability-verification\u002Fimg2.png",[],{"type":18,"tag":19,"props":2208,"children":2209},{},[2210],{"type":18,"tag":403,"props":2211,"children":2212},{"style":405},[2213],{"type":131,"value":2214},"图2：万里眼标准UB网络测试仪软件界面",{"type":18,"tag":19,"props":2216,"children":2217},{},[2218],{"type":131,"value":2219},"这次联合调试，不仅是技术层面的对接，更是UB生态产业链协同的一次重要实践。",{"type":18,"tag":605,"props":2221,"children":2222},{},[2223,2228,2233],{"type":18,"tag":609,"props":2224,"children":2225},{},[2226],{"type":131,"value":2227},"对UB生态而言，IP层的互通验证是整个生态繁荣的前提。芯片设计公司需要成熟可靠的IP支撑，系统厂商需要经过互操作验证的芯片产品，测试仪器厂商则需要真实硬件完善测试能力。验证打通了从IP到芯片、从系统到测试的最底层环节，为生态伙伴开展兼容性验证提供了可复现的范本。",{"type":18,"tag":609,"props":2229,"children":2230},{},[2231],{"type":131,"value":2232},"对国产算力互联而言，牛芯半导体作为国内少数具备完整SerDes与高速接口IP自主研发能力的企业，其UB协议IP的深度支持，意味着国内芯片设计公司在引入UB接口时，拥有了自主创新的IP选项，对算力基础设施的供应链安全具有战略意义。",{"type":18,"tag":609,"props":2234,"children":2235},{},[2236],{"type":131,"value":2237},"面向未来，牛芯将持续深化与生态伙伴的互操作测试，进一步提升IP的兼容性与稳定性；同时推动高速Serdes IP与控制器IP的协同迭代，面向112G及以上速率提供完整的全国产化接口IP解决方案。牛芯致力于成为UB生态中核心的IP供应商，为国产算力集群的规模化部署提供坚实支撑。",{"type":18,"tag":387,"props":2239,"children":2240},{"style":2153},[2241],{"type":18,"tag":164,"props":2242,"children":2244},{"id":2243},"灵衢互联社区兼容测试组工作组会议邀请",[2245],{"type":131,"value":2243},{"type":18,"tag":19,"props":2247,"children":2248},{},[2249,2251,2257],{"type":131,"value":2250},"灵衢互联社区计划在2026年3月下旬召开兼容测试组工作组会议，进行牛芯与万里眼测试仪的互操作测试，详细会议信息请关注灵衢互联社区官网日历（",{"type":18,"tag":134,"props":2252,"children":2255},{"href":2253,"rel":2254},"https:\u002F\u002Fwww.unifiedbus.com",[138],[2256],{"type":131,"value":2253},{"type":131,"value":2258},"）。",{"title":8,"searchDepth":28,"depth":28,"links":2260},[],"content:zh:news:UB-protocol-ipInteroperability-verification.md","zh\u002Fnews\u002FUB-protocol-ipInteroperability-verification.md","zh\u002Fnews\u002FUB-protocol-ipInteroperability-verification",{"_path":2265,"_dir":6,"_draft":7,"_partial":7,"_locale":8,"title":2266,"description":10,"date":2267,"cover":2268,"type":13,"isVideo":1841,"body":2269,"_type":30,"_id":2302,"_source":32,"_file":2303,"_stem":2304,"_extension":35},"\u002Fzh\u002Fnews\u002FUB-workgroup-meeting","【直播回放】灵衢互联社区筹备工作会议","2026\u002F01\u002F29","\u002Fcategory\u002Fnews\u002F2026-01-29\u002Fbanner.jpg",{"type":15,"children":2270,"toc":2300},[2271,2276],{"type":18,"tag":19,"props":2272,"children":2273},{},[2274],{"type":131,"value":2275},"为推动超节点互联技术创新发展，灵衢互联社区于 2026 年 1 月 29 日在上海召开首届社区季度工作会议，标志着社区筹备工作正式启动。",{"type":18,"tag":387,"props":2277,"children":2279},{"style":2278},"text-align: center;",[2280,2285,2290,2295],{"type":18,"tag":164,"props":2281,"children":2283},{"id":2282},"直播回放",[2284],{"type":131,"value":2282},{"type":18,"tag":2286,"props":2287,"children":2289},"content-live-video",{"video-id":2288},"16040",[],{"type":18,"tag":164,"props":2291,"children":2293},{"id":2292},"直播议程",[2294],{"type":131,"value":2292},{"type":18,"tag":23,"props":2296,"children":2299},{"src":2297,"alt":2298},"\u002Fcategory\u002Fnews\u002F2026-01-29\u002Flive.jpg","灵衢互联社区筹备工作会议议程海报",[],{"title":8,"searchDepth":28,"depth":28,"links":2301},[],"content:zh:news:UB-workgroup-meeting.md","zh\u002Fnews\u002FUB-workgroup-meeting.md","zh\u002Fnews\u002FUB-workgroup-meeting",{"_path":2306,"_dir":6,"_draft":7,"_partial":7,"_locale":8,"title":2307,"description":2308,"date":2309,"cover":2310,"type":13,"isVideo":1841,"body":2311,"_type":30,"_id":2530,"_source":32,"_file":2531,"_stem":2532,"_extension":35},"\u002Fzh\u002Fnews\u002FopenEuler-Summit-2025-UnifiedBus","【直播回放】openEuler Summit 2025灵衢分论坛","openEuler Summit 2025灵衢分论坛","2025\u002F11\u002F15 10:00","\u002Fcategory\u002Fnews\u002FopenEuler-Summit-2025-lingqu.jpg",{"type":15,"children":2312,"toc":2520},[2313,2318,2328,2333,2340,2345,2354,2358,2365,2370,2379,2383,2390,2395,2404,2408,2415,2420,2429,2433,2440,2445,2454,2458,2465,2470,2479,2483,2490,2495,2504,2508,2515],{"type":18,"tag":144,"props":2314,"children":2316},{"id":2315},"超节点和关键应用场景",[2317],{"type":131,"value":2315},{"type":18,"tag":19,"props":2319,"children":2320},{},[2321],{"type":18,"tag":134,"props":2322,"children":2325},{"href":2323,"rel":2324},"https:\u002F\u002Fcdn.unifiedbus.com\u002Fpdf\u002F2025%E6%93%8D%E4%BD%9C%E7%B3%BB%E7%BB%9F%E5%B3%B0%E4%BC%9A-%E7%81%B5%E8%A1%A2%E5%88%86%E8%AE%BA%E5%9D%9B-%E8%B6%85%E8%8A%82%E7%82%B9%E5%92%8C%E5%85%B3%E9%94%AE%E5%BA%94%E7%94%A8%E5%9C%BA%E6%99%AF.pdf",[138],[2326],{"type":131,"value":2327},"演讲材料下载",{"type":18,"tag":19,"props":2329,"children":2330},{},[2331],{"type":131,"value":2332},"(点击播放视频)",{"type":18,"tag":19,"props":2334,"children":2335},{},[2336],{"type":18,"tag":1838,"props":2337,"children":2339},{"src":2338,"poster":8,"controls":1841,"muted":1841},"https:\u002F\u002Fcdn.unifiedbus.com\u002Fvideo\u002F2025-11-26-7.mp4",[],{"type":18,"tag":144,"props":2341,"children":2343},{"id":2342},"灵衢总线技术和软件参考设计",[2344],{"type":131,"value":2342},{"type":18,"tag":19,"props":2346,"children":2347},{},[2348],{"type":18,"tag":134,"props":2349,"children":2352},{"href":2350,"rel":2351},"https:\u002F\u002Fcdn.unifiedbus.com\u002Fpdf\u002F2025%E6%93%8D%E4%BD%9C%E7%B3%BB%E7%BB%9F%E5%B3%B0%E4%BC%9A-%E7%81%B5%E8%A1%A2%E5%88%86%E8%AE%BA%E5%9D%9B-%E7%81%B5%E8%A1%A2%E6%80%BB%E7%BA%BF%E6%8A%80%E6%9C%AF%E5%92%8C%E8%BD%AF%E4%BB%B6%E5%8F%82%E8%80%83%E8%AE%BE%E8%AE%A1.pdf",[138],[2353],{"type":131,"value":2327},{"type":18,"tag":19,"props":2355,"children":2356},{},[2357],{"type":131,"value":2332},{"type":18,"tag":19,"props":2359,"children":2360},{},[2361],{"type":18,"tag":1838,"props":2362,"children":2364},{"src":2363,"poster":8,"controls":1841,"muted":1841},"https:\u002F\u002Fcdn.unifiedbus.com\u002Fvideo\u002F2025-11-26-5.mp4",[],{"type":18,"tag":144,"props":2366,"children":2368},{"id":2367},"灵衢内存池化关键技术和应用",[2369],{"type":131,"value":2367},{"type":18,"tag":19,"props":2371,"children":2372},{},[2373],{"type":18,"tag":134,"props":2374,"children":2377},{"href":2375,"rel":2376},"https:\u002F\u002Fcdn.unifiedbus.com\u002Fpdf\u002F2025%E6%93%8D%E4%BD%9C%E7%B3%BB%E7%BB%9F%E5%B3%B0%E4%BC%9A-%E7%81%B5%E8%A1%A2%E5%88%86%E8%AE%BA%E5%9D%9B-%E7%81%B5%E8%A1%A2%E5%86%85%E5%AD%98%E6%B1%A0%E5%8C%96%E5%85%B3%E9%94%AE%E6%8A%80%E6%9C%AF%E5%92%8C%E5%BA%94%E7%94%A8.pdf",[138],[2378],{"type":131,"value":2327},{"type":18,"tag":19,"props":2380,"children":2381},{},[2382],{"type":131,"value":2332},{"type":18,"tag":19,"props":2384,"children":2385},{},[2386],{"type":18,"tag":1838,"props":2387,"children":2389},{"src":2388,"poster":8,"controls":1841,"muted":1841},"https:\u002F\u002Fcdn.unifiedbus.com\u002Fvideo\u002F2025-11-26-1.mp4",[],{"type":18,"tag":144,"props":2391,"children":2393},{"id":2392},"灵衢通信关键技术和应用",[2394],{"type":131,"value":2392},{"type":18,"tag":19,"props":2396,"children":2397},{},[2398],{"type":18,"tag":134,"props":2399,"children":2402},{"href":2400,"rel":2401},"https:\u002F\u002Fcdn.unifiedbus.com\u002Fpdf\u002F2025%E6%93%8D%E4%BD%9C%E7%B3%BB%E7%BB%9F%E5%B3%B0%E4%BC%9A-%E7%81%B5%E8%A1%A2%E5%88%86%E8%AE%BA%E5%9D%9B-%E7%81%B5%E8%A1%A2%E9%80%9A%E4%BF%A1%E5%85%B3%E9%94%AE%E6%8A%80%E6%9C%AF%E5%92%8C%E5%BA%94%E7%94%A8.pdf",[138],[2403],{"type":131,"value":2327},{"type":18,"tag":19,"props":2405,"children":2406},{},[2407],{"type":131,"value":2332},{"type":18,"tag":19,"props":2409,"children":2410},{},[2411],{"type":18,"tag":1838,"props":2412,"children":2414},{"src":2413,"poster":8,"controls":1841,"muted":1841},"https:\u002F\u002Fcdn.unifiedbus.com\u002Fvideo\u002F2025-11-26-3.mp4",[],{"type":18,"tag":144,"props":2416,"children":2418},{"id":2417},"灵衢设备虚拟化关键技术和应用",[2419],{"type":131,"value":2417},{"type":18,"tag":19,"props":2421,"children":2422},{},[2423],{"type":18,"tag":134,"props":2424,"children":2427},{"href":2425,"rel":2426},"https:\u002F\u002Fcdn.unifiedbus.com\u002Fpdf\u002F2025%E6%93%8D%E4%BD%9C%E7%B3%BB%E7%BB%9F%E5%B3%B0%E4%BC%9A-%E7%81%B5%E8%A1%A2%E5%88%86%E8%AE%BA%E5%9D%9B-%E7%81%B5%E8%A1%A2%E8%AE%BE%E5%A4%87%E8%99%9A%E6%8B%9F%E5%8C%96%E5%85%B3%E9%94%AE%E6%8A%80%E6%9C%AF%E5%92%8C%E5%BA%94%E7%94%A8.pdf",[138],[2428],{"type":131,"value":2327},{"type":18,"tag":19,"props":2430,"children":2431},{},[2432],{"type":131,"value":2332},{"type":18,"tag":19,"props":2434,"children":2435},{},[2436],{"type":18,"tag":1838,"props":2437,"children":2439},{"src":2438,"poster":8,"controls":1841,"muted":1841},"https:\u002F\u002Fcdn.unifiedbus.com\u002Fvideo\u002F2025-11-26-2.mp4",[],{"type":18,"tag":144,"props":2441,"children":2443},{"id":2442},"超节点可靠性关键技术",[2444],{"type":131,"value":2442},{"type":18,"tag":19,"props":2446,"children":2447},{},[2448],{"type":18,"tag":134,"props":2449,"children":2452},{"href":2450,"rel":2451},"https:\u002F\u002Fcdn.unifiedbus.com\u002Fpdf\u002F2025%E6%93%8D%E4%BD%9C%E7%B3%BB%E7%BB%9F%E5%B3%B0%E4%BC%9A-%E7%81%B5%E8%A1%A2%E5%88%86%E8%AE%BA%E5%9D%9B-%E8%B6%85%E8%8A%82%E7%82%B9%E5%8F%AF%E9%9D%A0%E6%80%A7%E5%85%B3%E9%94%AE%E6%8A%80%E6%9C%AF.pdf",[138],[2453],{"type":131,"value":2327},{"type":18,"tag":19,"props":2455,"children":2456},{},[2457],{"type":131,"value":2332},{"type":18,"tag":19,"props":2459,"children":2460},{},[2461],{"type":18,"tag":1838,"props":2462,"children":2464},{"src":2463,"poster":8,"controls":1841,"muted":1841},"https:\u002F\u002Fcdn.unifiedbus.com\u002Fvideo\u002F2025-11-26-8.mp4",[],{"type":18,"tag":144,"props":2466,"children":2468},{"id":2467},"灵衢系统高阶服务关键技术和应用",[2469],{"type":131,"value":2467},{"type":18,"tag":19,"props":2471,"children":2472},{},[2473],{"type":18,"tag":134,"props":2474,"children":2477},{"href":2475,"rel":2476},"https:\u002F\u002Fcdn.unifiedbus.com\u002Fpdf\u002F2025%E6%93%8D%E4%BD%9C%E7%B3%BB%E7%BB%9F%E5%B3%B0%E4%BC%9A-%E7%81%B5%E8%A1%A2%E5%88%86%E8%AE%BA%E5%9D%9B-%E7%81%B5%E8%A1%A2%E7%B3%BB%E7%BB%9F%E9%AB%98%E9%98%B6%E6%9C%8D%E5%8A%A1%E5%85%B3%E9%94%AE%E6%8A%80%E6%9C%AF%E5%92%8C%E5%BA%94%E7%94%A8.pdf",[138],[2478],{"type":131,"value":2327},{"type":18,"tag":19,"props":2480,"children":2481},{},[2482],{"type":131,"value":2332},{"type":18,"tag":19,"props":2484,"children":2485},{},[2486],{"type":18,"tag":1838,"props":2487,"children":2489},{"src":2488,"poster":8,"controls":1841,"muted":1841},"https:\u002F\u002Fcdn.unifiedbus.com\u002Fvideo\u002F2025-11-26-4.mp4",[],{"type":18,"tag":144,"props":2491,"children":2493},{"id":2492},"超节点编程编译关键技术",[2494],{"type":131,"value":2492},{"type":18,"tag":19,"props":2496,"children":2497},{},[2498],{"type":18,"tag":134,"props":2499,"children":2502},{"href":2500,"rel":2501},"https:\u002F\u002Fcdn.unifiedbus.com\u002Fpdf\u002F2025%E6%93%8D%E4%BD%9C%E7%B3%BB%E7%BB%9F%E5%B3%B0%E4%BC%9A-%E7%81%B5%E8%A1%A2%E5%88%86%E8%AE%BA%E5%9D%9B-%E8%B6%85%E8%8A%82%E7%82%B9%E7%BC%96%E7%A8%8B%E7%BC%96%E8%AF%91%E5%85%B3%E9%94%AE%E6%8A%80%E6%9C%AF.pdf",[138],[2503],{"type":131,"value":2327},{"type":18,"tag":19,"props":2505,"children":2506},{},[2507],{"type":131,"value":2332},{"type":18,"tag":19,"props":2509,"children":2510},{},[2511],{"type":18,"tag":1838,"props":2512,"children":2514},{"src":2513,"poster":8,"controls":1841,"muted":1841},"https:\u002F\u002Fcdn.unifiedbus.com\u002Fvideo\u002F2025-11-26-6.mp4",[],{"type":18,"tag":1785,"props":2516,"children":2517},{},[2518],{"type":131,"value":2519}," \n  video { \n    @media screen and (min-width: 600px) {\n      width: 60% !important;\n    }\n  }\n",{"title":8,"searchDepth":28,"depth":28,"links":2521},[2522,2523,2524,2525,2526,2527,2528,2529],{"id":2315,"depth":988,"text":2315},{"id":2342,"depth":988,"text":2342},{"id":2367,"depth":988,"text":2367},{"id":2392,"depth":988,"text":2392},{"id":2417,"depth":988,"text":2417},{"id":2442,"depth":988,"text":2442},{"id":2467,"depth":988,"text":2467},{"id":2492,"depth":988,"text":2492},"content:zh:news:openEuler-Summit-2025-UnifiedBus.md","zh\u002Fnews\u002FopenEuler-Summit-2025-UnifiedBus.md","zh\u002Fnews\u002FopenEuler-Summit-2025-UnifiedBus",{"_path":2534,"_dir":6,"_draft":7,"_partial":7,"_locale":8,"title":2535,"description":2536,"date":2537,"cover":2538,"type":13,"isVideo":1841,"body":2539,"_type":30,"_id":2590,"_source":32,"_file":2591,"_stem":2592,"_extension":35},"\u002Fzh\u002Fnews\u002F2025-11-07-live","【直播回放】灵衢技术讲解与答疑直播专场","对话灵衢专家团：聚焦高频问题，深度技术解读","2025\u002F11\u002F11 15:00","\u002Fcategory\u002Fnews\u002F2025-11-07\u002Fbanner.jpg",{"type":15,"children":2540,"toc":2588},[2541],{"type":18,"tag":387,"props":2542,"children":2543},{"style":2278},[2544,2550,2559,2565,2573],{"type":18,"tag":164,"props":2545,"children":2547},{"id":2546},"灵衢技术讲解-灵衢协议架构和芯片实践",[2548],{"type":131,"value":2549},"灵衢技术讲解 - 灵衢协议架构和芯片实践",{"type":18,"tag":19,"props":2551,"children":2552},{},[2553,2555],{"type":131,"value":2554},"(点击播放视频)\n",{"type":18,"tag":1838,"props":2556,"children":2558},{"src":2557,"poster":2538,"controls":1841,"muted":1841},"https:\u002F\u002Fcdn.unifiedbus.com\u002Fvideo\u002F2025-11-13-1.mp4",[],{"type":18,"tag":164,"props":2560,"children":2562},{"id":2561},"灵衢技术答疑-对话灵衢专家团",[2563],{"type":131,"value":2564},"灵衢技术答疑 - 对话灵衢专家团",{"type":18,"tag":19,"props":2566,"children":2567},{},[2568,2569],{"type":131,"value":2554},{"type":18,"tag":1838,"props":2570,"children":2572},{"src":2571,"poster":2538,"controls":1841,"muted":1841},"https:\u002F\u002Fcdn.unifiedbus.com\u002Fvideo\u002F2025-11-13-2.mp4",[],{"type":18,"tag":387,"props":2574,"children":2576},{"style":2575},"margin-top: 40px;",[2577,2581,2586],{"type":18,"tag":164,"props":2578,"children":2579},{"id":2292},[2580],{"type":131,"value":2292},{"type":18,"tag":23,"props":2582,"children":2585},{"src":2583,"alt":2584},"\u002Fcategory\u002Fnews\u002F2025-11-07\u002Flive.jpg","灵衢技术讲解与答疑直播专场海报",[],{"type":131,"value":2587},"  \n",{"title":8,"searchDepth":28,"depth":28,"links":2589},[],"content:zh:news:2025-11-07-live.md","zh\u002Fnews\u002F2025-11-07-live.md","zh\u002Fnews\u002F2025-11-07-live",{"_path":2594,"_dir":6,"_draft":7,"_partial":7,"_locale":8,"title":2595,"description":2595,"date":2596,"cover":2597,"type":6,"body":2598,"_type":30,"_id":2636,"_source":32,"_file":2637,"_stem":2638,"_extension":35},"\u002Fzh\u002Fnews\u002Fhc-2025-09-news","一图读懂基于灵衢的超节点架构创新和系列产品","2025\u002F09\u002F22 18:00","\u002Fcategory\u002Fnews\u002F2025-09-18\u002Fnews-banner.jpg",{"type":15,"children":2599,"toc":2634},[2600],{"type":18,"tag":387,"props":2601,"children":2602},{"style":2278},[2603,2605,2609,2610,2614,2615,2619,2620,2624,2625,2629,2630],{"type":131,"value":2604},"\n  ",{"type":18,"tag":23,"props":2606,"children":2608},{"src":2607,"alt":2595},"\u002Fcategory\u002Fnews\u002F2025-09-18\u002Fimg1.jpg",[],{"type":131,"value":2604},{"type":18,"tag":23,"props":2611,"children":2613},{"src":2612,"alt":2595},"\u002Fcategory\u002Fnews\u002F2025-09-18\u002Fimg2.jpg",[],{"type":131,"value":2604},{"type":18,"tag":23,"props":2616,"children":2618},{"src":2617,"alt":2595},"\u002Fcategory\u002Fnews\u002F2025-09-18\u002Fimg3.jpg",[],{"type":131,"value":2604},{"type":18,"tag":23,"props":2621,"children":2623},{"src":2622,"alt":2595},"\u002Fcategory\u002Fnews\u002F2025-09-18\u002Fimg4.jpg",[],{"type":131,"value":2604},{"type":18,"tag":23,"props":2626,"children":2628},{"src":2627,"alt":2595},"\u002Fcategory\u002Fnews\u002F2025-09-18\u002Fimg5.jpg",[],{"type":131,"value":2604},{"type":18,"tag":23,"props":2631,"children":2633},{"src":2632,"alt":2595},"\u002Fcategory\u002Fnews\u002F2025-09-18\u002Fimg6.jpg",[],{"title":8,"searchDepth":28,"depth":28,"links":2635},[],"content:zh:news:hc-2025-09-news.md","zh\u002Fnews\u002Fhc-2025-09-news.md","zh\u002Fnews\u002Fhc-2025-09-news",{"_path":2640,"_dir":6,"_draft":7,"_partial":7,"_locale":8,"title":2641,"description":2642,"date":2643,"cover":2644,"type":13,"body":2645,"_type":30,"_id":2749,"_source":32,"_file":2750,"_stem":2751,"_extension":35},"\u002Fzh\u002Fnews\u002Fhc-2025-09-forum","灵衢技术论坛圆满落幕，超节点互联协议细节首度公开","在华为全联接大会2025期间，以 “灵衢，面向超节点的互联协议”为主题的技术论坛在上海世博中心成功举办。","2025\u002F09\u002F22 17:30","\u002Fcategory\u002Fnews\u002F2025-09-18\u002Fforum1.jpg",{"type":15,"children":2646,"toc":2747},[2647,2652,2657,2672,2677,2692,2697,2712,2717,2732,2737],{"type":18,"tag":19,"props":2648,"children":2649},{},[2650],{"type":131,"value":2651},"[中国，上海，2025 年 9 月 19 日] 在华为全联接大会 2025 期间，以 “灵衢，面向超节点的互联协议”为主题的技术论坛在上海世博中心成功举办。会上首次对“灵衢”进行了全方位深度解读。互联网领军企业、设备厂商、科研机构等领域的 170+位专家到场，共同探讨新型互联技术与超节点参考架构，以开创的超节点互联协议，引领 AI 基础设施新范式。",{"type":18,"tag":19,"props":2653,"children":2654},{},[2655],{"type":131,"value":2656},"论坛由华为集群计算总经理朱照生先生致辞拉开序幕。他介绍到，无论是智算场景，还是通算场景，超节点正成为算力基础设施建设的新常态。华为围绕灵衢持续深耕，厚积薄发，为超节点建设提供一条经过规模商用实践的高效路径。本次会议，我们将针对灵衢进行深入解读：灵衢给算力部署带来的变化，灵衢协议设计的底层逻辑，与现有互联技术的根本区别等。",{"type":18,"tag":387,"props":2658,"children":2659},{"style":389},[2660,2667],{"type":18,"tag":19,"props":2661,"children":2662},{},[2663],{"type":18,"tag":23,"props":2664,"children":2666},{"alt":2665,"src":2644},"图片",[],{"type":18,"tag":19,"props":2668,"children":2669},{},[2670],{"type":131,"value":2671},"华为集群计算总经理 朱照生",{"type":18,"tag":19,"props":2673,"children":2674},{},[2675],{"type":131,"value":2676},"协议与芯片架构师程传宁讲解了灵衢在系统逻辑、协议设计、场景化应用上的技术优势。他从计算系统四个维度目标出发，介绍灵衢的构建逻辑、协议栈框架、内部研发过程及目标部署，展现华为将灵衢作为战略研发投入的全貌，强调灵衢是经多颗芯片验证的成熟超节点互联技术。随后，他阐述三大系统创新主张：“超节点”是“逻辑上的一台计算机”“超级单一节点”，非“超级多个松散节点集”，并明确其必备能力；计算机互联能够且应物理归一；互连拓扑应务实采用多种及混合拓扑，以实现最佳时延与成本结构。之后，他以架构师视角举例说明协议各层特性设计如何为用户创造价值。最后，通过对比现有主流互联协议，结论为：灵衢可覆盖其他互联应用场景且特性更优，而尚无任何既有或已公开互联体系能完备覆盖灵衢。",{"type":18,"tag":387,"props":2678,"children":2679},{"style":389},[2680,2687],{"type":18,"tag":19,"props":2681,"children":2682},{},[2683],{"type":18,"tag":23,"props":2684,"children":2686},{"alt":2665,"src":2685},"\u002Fcategory\u002Fnews\u002F2025-09-18\u002Fforum2.jpg",[],{"type":18,"tag":19,"props":2688,"children":2689},{},[2690],{"type":131,"value":2691},"灵衢协议与芯片架构师 程传宁",{"type":18,"tag":19,"props":2693,"children":2694},{},[2695],{"type":131,"value":2696},"灵衢软件架构师孙宏伟则聚焦于灵衢软件栈的核心能力与系统功能。他表示，基于灵衢的超节点可实现资源池化，打破单机边界，构建多样性算力集群，从而实现集群级的高性能计算。在分享中，他围绕灵衢超节点具备的 7 大核心能力，引出 18 个系统功能，深入讲解了灵衢软件栈的实现原理与技术优势。在分享的最后，他公布了灵衢软件开源网址信息，欢迎各位开发者下载取用。",{"type":18,"tag":387,"props":2698,"children":2699},{"style":389},[2700,2707],{"type":18,"tag":19,"props":2701,"children":2702},{},[2703],{"type":18,"tag":23,"props":2704,"children":2706},{"alt":2665,"src":2705},"\u002Fcategory\u002Fnews\u002F2025-09-18\u002Fforum3.jpg",[],{"type":18,"tag":19,"props":2708,"children":2709},{},[2710],{"type":131,"value":2711},"灵衢软件技术架构师 孙宏伟",{"type":18,"tag":19,"props":2713,"children":2714},{},[2715],{"type":131,"value":2716},"灵衢系统架构师吴沛全面介绍了灵衢的各项组件，并结合智算与通算典型场景，具体分析了训练、推理、虚拟化与大数据部署灵衢的实际应用收益。AI 大模型训练场景，通过超节点互联降低通信占比，端到端性能收益达到 20%+；通算数据库场景，通过三层池化支撑多写多读，TPCC 提升 20%。结论表明，灵衢技术特别适合高并行、高同步的负载特征场景，能为业务带来显著提升。",{"type":18,"tag":387,"props":2718,"children":2719},{"style":389},[2720,2727],{"type":18,"tag":19,"props":2721,"children":2722},{},[2723],{"type":18,"tag":23,"props":2724,"children":2726},{"alt":2665,"src":2725},"\u002Fcategory\u002Fnews\u002F2025-09-18\u002Fforum4.jpg",[],{"type":18,"tag":19,"props":2728,"children":2729},{},[2730],{"type":131,"value":2731},"灵衢系统架构师 吴沛",{"type":18,"tag":19,"props":2733,"children":2734},{},[2735],{"type":131,"value":2736},"本次论坛作为灵衢发布后的首次公开解读，全面展现了华为在计算生态战略上的方针：硬件开放、软件开源、使能伙伴、发展人才。我们相信，随着更多合作伙伴的加入，灵衢将持续促进 AI 技术创新与产业繁荣。",{"type":18,"tag":387,"props":2738,"children":2739},{"style":389},[2740],{"type":18,"tag":19,"props":2741,"children":2742},{},[2743],{"type":18,"tag":23,"props":2744,"children":2746},{"alt":2665,"src":2745},"\u002Fcategory\u002Fnews\u002F2025-09-18\u002Fforum5.jpg",[],{"title":8,"searchDepth":28,"depth":28,"links":2748},[],"content:zh:news:hc-2025-09-forum.md","zh\u002Fnews\u002Fhc-2025-09-forum.md","zh\u002Fnews\u002Fhc-2025-09-forum",{"_path":2753,"_dir":6,"_draft":7,"_partial":7,"_locale":8,"title":2754,"description":2755,"date":2756,"cover":2757,"type":1838,"body":2758,"_type":30,"_id":2776,"_source":32,"_file":2777,"_stem":2778,"_extension":35},"\u002Fzh\u002Fnews\u002Fhc-2025-09-video","华为坚持硬件开放、软件开源、支持伙伴和开发者创新、共建繁荣生态","HC 2025期间，华为董事、ICT BG CEO杨超斌表示：“华为坚持硬件开放、软件开源，支持伙伴和开发者创新，共建繁荣生态。”","2025\u002F09\u002F19 18:00","\u002Fcategory\u002Fnews\u002F2025-09-18\u002Fvideo-img3.jpg",{"type":15,"children":2759,"toc":2774},[2760,2764],{"type":18,"tag":19,"props":2761,"children":2762},{},[2763],{"type":131,"value":2755},{"type":18,"tag":387,"props":2765,"children":2768},{"className":2766},[2767],"video-container",[2769,2770],{"type":131,"value":2604},{"type":18,"tag":1838,"props":2771,"children":2773},{"src":2772,"poster":2757,"controls":1841,"muted":1841},"https:\u002F\u002Fcdn.unifiedbus.com\u002Fvideo\u002F2025-09-hc-03.mp4",[],{"title":8,"searchDepth":28,"depth":28,"links":2775},[],"content:zh:news:hc-2025-09-video.md","zh\u002Fnews\u002Fhc-2025-09-video.md","zh\u002Fnews\u002Fhc-2025-09-video",{"_path":2780,"_dir":6,"_draft":7,"_partial":7,"_locale":8,"title":2781,"description":2782,"date":2783,"cover":2784,"type":1838,"body":2785,"_type":30,"_id":2802,"_source":32,"_file":2803,"_stem":2804,"_extension":35},"\u002Fzh\u002Fnews\u002Fhc-superpod-innovation-video","基于灵衢互联协议，坚持开源开放，共筑全场景算力底座","HC 2025期间，华为董事、ICT BG CEO杨超斌表示：“华为将基于灵衢互联协议，坚持开源开放，共筑全场景算力底座。”","2025\u002F09\u002F19 17:50","\u002Fcategory\u002Fnews\u002F2025-09-18\u002Fvideo-img2.jpg",{"type":15,"children":2786,"toc":2800},[2787,2791],{"type":18,"tag":19,"props":2788,"children":2789},{},[2790],{"type":131,"value":2782},{"type":18,"tag":387,"props":2792,"children":2794},{"className":2793},[2767],[2795,2796],{"type":131,"value":2604},{"type":18,"tag":1838,"props":2797,"children":2799},{"src":2798,"poster":2784,"controls":1841,"muted":1841},"https:\u002F\u002Fcdn.unifiedbus.com\u002Fvideo\u002F2025-09-hc-01.mp4",[],{"title":8,"searchDepth":28,"depth":28,"links":2801},[],"content:zh:news:hc-superpod-innovation-video.md","zh\u002Fnews\u002Fhc-superpod-innovation-video.md","zh\u002Fnews\u002Fhc-superpod-innovation-video",{"_path":2806,"_dir":6,"_draft":7,"_partial":7,"_locale":8,"title":2807,"description":2808,"date":2809,"cover":2810,"type":1838,"body":2811,"_type":30,"_id":2829,"_source":32,"_file":2830,"_stem":2831,"_extension":35},"\u002Fzh\u002Fnews\u002Fhc-lingqu-ai-superpod-video","灵衢为超节点而生，是构建算力集群产品最优的互联技术","9月18日，华为副董事长、轮值董事长徐直军宣布推出两款基于灵衢的超节点集群Atlas 950 SuperCluster和Atlas 960 SuperCluster，算力规模分别超过50万卡和达到百万卡，是当之无愧的全世界最强算力集群。","2025\u002F09\u002F19 17:30","\u002Fcategory\u002Fnews\u002F2025-09-18\u002Fvideo-img1.jpg",{"type":15,"children":2812,"toc":2827},[2813,2818],{"type":18,"tag":19,"props":2814,"children":2815},{},[2816],{"type":131,"value":2817},"9 月 18 日，华为副董事长、轮值董事长徐直军宣布推出两款基于灵衢的超节点集群 Atlas 950 SuperCluster 和 Atlas 960 SuperCluster，算力规模分别超过 50 万卡和达到百万卡，是当之无愧的全世界最强算力集群。",{"type":18,"tag":387,"props":2819,"children":2821},{"className":2820},[2767],[2822,2823],{"type":131,"value":2604},{"type":18,"tag":1838,"props":2824,"children":2826},{"src":2825,"poster":2810,"controls":1841,"muted":1841},"https:\u002F\u002Fcdn.unifiedbus.com\u002Fvideo\u002F2025-09-hc-06.mp4",[],{"title":8,"searchDepth":28,"depth":28,"links":2828},[],"content:zh:news:hc-lingqu-ai-superpod-video.md","zh\u002Fnews\u002Fhc-lingqu-ai-superpod-video.md","zh\u002Fnews\u002Fhc-lingqu-ai-superpod-video",{"_path":2833,"_dir":6,"_draft":7,"_partial":7,"_locale":8,"title":2834,"description":2835,"date":2836,"cover":2837,"type":6,"body":2838,"_type":30,"_id":3306,"_source":32,"_file":3307,"_stem":3308,"_extension":35},"\u002Fzh\u002Fnews\u002Fhc-xu-keynote-speech","以开创的超节点互联技术，引领AI基础设施新范式","徐直军在华为全联接大会2025上的主题演讲","2025\u002F09\u002F18 17:30","\u002Fcategory\u002Fnews\u002F2025-09-18\u002F250918-02.jpg",{"type":15,"children":2839,"toc":3304},[2840,2845,2850,2878,2890,2895,2918,2923,2928,2933,2938,2950,2973,2978,2983,2988,2993,2998,3003,3008,3013,3018,3046,3051,3056,3061,3073,3091,3096,3101,3113,3118,3123,3128,3133,3138,3143,3155,3160,3165,3170,3175,3180,3185,3198,3203,3208,3213,3218,3223,3234,3239,3244,3249,3261,3266,3271,3276,3288,3293],{"type":18,"tag":19,"props":2841,"children":2842},{},[2843],{"type":131,"value":2844},"[中国，上海，2025 年 9 月 18 日] 女士们、先生们，各位老朋友、新朋友，大家上午好！欢迎来参加 2025 年华为全联接大会，时隔一年，很高兴再次与大家相聚在上海。我想大家都能感受到，过去的一年对所有 AI 从业者、关注者来讲是记忆深刻的一年，DeepSeek 横空出世，让全国人民过了一个快乐的 AI 年，也让所有大模型训练者开启了不知多少个不眠之夜，调整训练方式，复现 DeepSeek 结果，当然也给我们带来了巨大冲击。从春节开始，到今年 4 月 30 日，经过多团队的协同作战，终于使 Ascend 910B\u002F910C 的推理能力达成了客户的基本需求。",{"type":18,"tag":19,"props":2846,"children":2847},{},[2848],{"type":131,"value":2849},"在进入今天的具体分享之前，请允许我回顾一下去年的 HC，我讲到了如下几点：",{"type":18,"tag":605,"props":2851,"children":2852},{},[2853,2858,2863,2868,2873],{"type":18,"tag":609,"props":2854,"children":2855},{},[2856],{"type":131,"value":2857},"第一、智能化的可持续，首先是算力的可持续；",{"type":18,"tag":609,"props":2859,"children":2860},{},[2861],{"type":131,"value":2862},"第二、中国半导体制造工艺将在相当长时间处于落后状态；",{"type":18,"tag":609,"props":2864,"children":2865},{},[2866],{"type":131,"value":2867},"第三、可持续的算力只能基于实际可获得的芯片制造工艺；",{"type":18,"tag":609,"props":2869,"children":2870},{},[2871],{"type":131,"value":2872},"第四、人工智能成为主导性算力需求，促使计算系统正在发生结构性变化；",{"type":18,"tag":609,"props":2874,"children":2875},{},[2876],{"type":131,"value":2877},"第五、开创计算架构，打造“超节点+集群”算力解决方案持续满足算力需求。",{"type":18,"tag":19,"props":2879,"children":2880},{},[2881,2883,2888],{"type":131,"value":2882},"但第五点没有展开讲，本来想讲，但我的团队不同意。今天，我想利用此机会，来把我去年 HC 没有完成的任务完成，也算是答卷。",{"type":18,"tag":181,"props":2884,"children":2885},{},[2886],{"type":131,"value":2887},"我今天分享的主题是：“以开创的超节点互联技术，引领 AI 基础设施新范式”",{"type":131,"value":2889},"，也是回答去年 HC 提到的第五点：如何开创计算架构，打造 “超节点+集群”算力解决方案来持续满足算力需求。",{"type":18,"tag":19,"props":2891,"children":2892},{},[2893],{"type":131,"value":2894},"在展开今天主题前，回到 DeepSeek 对产业界、对华为的冲击，DeepSeek 开源后，我们的客户对华为的昇腾发展指出了很多问题，也充满了期待，并一直在给我们不断地提建议。为此，经过内部的充分讨论并达成共识，我们于 2025 年 8 月 5 日在北京专门举办了昇腾产业峰会，我代表华为给出了回应，在座的有的参加了，有的可能没有参加。今天，我也利用此机会就主要的决定给大家汇报一下。主要有四点：",{"type":18,"tag":605,"props":2896,"children":2897},{},[2898,2903,2908,2913],{"type":18,"tag":609,"props":2899,"children":2900},{},[2901],{"type":131,"value":2902},"一、华为坚持昇腾硬件变现；",{"type":18,"tag":609,"props":2904,"children":2905},{},[2906],{"type":131,"value":2907},"二、CANN 编译器和虚拟指令集接口开放，其它软件全开源，CANN 基于 Ascend 910B\u002FC 的开源开放将于 2025 年 12 月 31 日前完成，未来开源开放与产品上市同步；",{"type":18,"tag":609,"props":2909,"children":2910},{},[2911],{"type":131,"value":2912},"三、Mind 系列应用使能套件及工具链全面开源，并于 2025 年 12 月 31 日前完成；",{"type":18,"tag":609,"props":2914,"children":2915},{},[2916],{"type":131,"value":2917},"四、openPangu 基础大模型全面开源。",{"type":18,"tag":19,"props":2919,"children":2920},{},[2921],{"type":131,"value":2922},"接下来回到今天的主题。尽管 DeepSeek 开创的模式可以大幅减少算力需求，但要走向 AGI、要走向物理 AI，我们认为，算力，过去是，未来也将继续是人工智能的关键，更是中国人工智能的关键。",{"type":18,"tag":19,"props":2924,"children":2925},{},[2926],{"type":131,"value":2927},"算力的基础是芯片，昇腾芯片是华为 AI 算力战略的基础。自 2018 年发布 Ascend 310 芯片，2019 年发布 Ascend 910 芯片，到 2025 年，Ascend 910C 芯片随着 Atlas 900 超节点规模部署，为大家所熟悉。在过去几年，客户和伙伴们对昇腾芯片有很多诉求，对昇腾芯片也有很多期待。面向未来，华为的芯片路标是如何规划的？想必是大家普遍关心的话题，可能也是最关心的内容。",{"type":18,"tag":19,"props":2929,"children":2930},{},[2931],{"type":131,"value":2932},"因此，今天，我就直入主题来介绍昇腾芯片及其路标。我很确定地告诉大家，昇腾芯片将持续演进，为中国乃至世界的 AI 算力构筑坚固根基。",{"type":18,"tag":19,"props":2934,"children":2935},{},[2936],{"type":131,"value":2937},"未来 3 年，至 2028 年，我们在开发和规划了三个系列，分别是 Ascend 950 系列，包括两颗芯片：Ascend 950PR 和 Ascend 950DT，以及 Ascend 960、Ascend 970 系列，更多具体芯片还在规划中。下面我分别介绍快要推出的和已规划的 4 颗昇腾芯片。",{"type":18,"tag":19,"props":2939,"children":2940},{},[2941,2943,2948],{"type":131,"value":2942},"我们正在开发、且即将推出的芯片叫",{"type":18,"tag":181,"props":2944,"children":2945},{},[2946],{"type":131,"value":2947},"Ascend 950 系列",{"type":131,"value":2949},"。我首先介绍一下 Ascend 950 系列的芯片架构，Ascend 950 PR 和 Ascend 950 DT 共用了 Ascend 950 Die。与前一代昇腾芯片相比，Ascend 950 在以下几个方面实现了根本性提升。",{"type":18,"tag":605,"props":2951,"children":2952},{},[2953,2958,2963,2968],{"type":18,"tag":609,"props":2954,"children":2955},{},[2956],{"type":131,"value":2957},"第一，新增支持业界标准 FP8\u002FMXFP8\u002FMXFP4 等低数值精度数据格式，算力分别达到 1P 和 2P，提升训练效率和推理吞吐。并特别支持华为自研的 HiF8，在保持 FP8 的高效的同时，精度非常接近 FP16。",{"type":18,"tag":609,"props":2959,"children":2960},{},[2961],{"type":131,"value":2962},"第二，大幅度提升了向量算力。这主要通过三个方面实现：其一，提升向量算力占比；其二，采用创新的新同构设计，即支持 SIMD\u002FSIMT 双编程模型，SIMD 能够像流水线一样处理“大块”向量，而 SIMT 便于灵活处理“碎片化”数据；其三，把内存访问颗粒度从 512 字节减少到 128 字节，内存访问更精细，从而更好地支持了离散且不连续的内存访问。",{"type":18,"tag":609,"props":2964,"children":2965},{},[2966],{"type":131,"value":2967},"第三，互联带宽相比 Ascend 910C 提升了 2.5 倍，达到 2TB\u002Fs。",{"type":18,"tag":609,"props":2969,"children":2970},{},[2971],{"type":131,"value":2972},"第四，结合推理不同阶段对于算力、内存、访存带宽及推荐、训练的需求不同，我们自研了两种 HBM，分别是：HiBL 1.0 和 HiZQ 2.0。不同的自研 HBM 与 Ascend 950 Die 合封，分别构成芯片 Ascend 950PR：面向 Prefill 和推荐场景，以及 Ascend 950DT：面向 Decode 和训练场景。",{"type":18,"tag":19,"props":2974,"children":2975},{},[2976],{"type":131,"value":2977},"下面分别介绍。",{"type":18,"tag":19,"props":2979,"children":2980},{},[2981],{"type":131,"value":2982},"首先是我们的第一颗芯片，Ascend 950PR，主要面向推理 Prefill 阶段和推荐业务场景。首先，我们发现，随着 Agent 的快速发展，输入上下文越来越长，首 Token 输出阶段占用计算资源越来越多。其次是在电子商务、内容平台、社交媒体等业务应用中，要求推荐算法具有更高的准确度和更低的时延，对计算能力的需求也越来越大。推理 Prefill 阶段和推荐算法都是计算密集型，对计算并行的能力要求高，但对内存访问带宽的需求相对低。通过分级内存解决方案，推理 Prefill 阶段和推荐算法对本地内存容量的需求相对也不高。Ascend 950PR 采用了华为自研的低成本 HBM，HiBL 1.0，相比高性能、高价格的 HBM3e\u002F4e，能够大大降低推理 Prefill 阶段和推荐业务的投资。",{"type":18,"tag":19,"props":2984,"children":2985},{},[2986],{"type":131,"value":2987},"这颗芯片将在 2026 年一季度推出，首先支持的产品形态是标卡和超节点服务器。",{"type":18,"tag":19,"props":2989,"children":2990},{},[2991],{"type":131,"value":2992},"接下来这一颗是 Ascend 950DT，相比 Ascend 950PR，它更注重推理 Decode 阶段和训练场景。由于推理 Decode 阶段和训练对互联带宽和访存带宽要求高，我们开发了 HiZQ 2.0，使内存容量达到 144GB，内存访问带宽达到 4TB\u002Fs。同时把互联带宽提升到了 2TB\u002Fs。其次，支持了 FP8\u002FMXFP8\u002FMXFP4\u002FHiF8 数据格式。",{"type":18,"tag":19,"props":2994,"children":2995},{},[2996],{"type":131,"value":2997},"Ascend 950DT 将在 2026 年 Q4 推出。",{"type":18,"tag":19,"props":2999,"children":3000},{},[3001],{"type":131,"value":3002},"第三颗是在规划中的芯片 Ascend 960。它在算力、内存访问带宽、内存容量、互联端口数等各种规格上相比 Ascend 950 翻倍，大幅度提升训练、推理等场景的性能；同时还支持华为自研的 HiF4 数据格式。它是目前业界最优的 4bit 精度实现，能进一步提升推理吞吐，并且比业界 FP4 方案的推理精度更优。",{"type":18,"tag":19,"props":3004,"children":3005},{},[3006],{"type":131,"value":3007},"Ascend 960 将在 2027 年四季度推出。",{"type":18,"tag":19,"props":3009,"children":3010},{},[3011],{"type":131,"value":3012},"最后一颗是在规划中的 Ascend 970，这颗芯片的一些规格还在讨论中。总体方向是，在各项指标上大幅度升级，全面升级训练和推理性能。目前的初步考虑是，相比 Ascend 960，Ascend 970 的 FP4 算力、FP8 算力、互联带宽要全面翻倍，内存访问带宽至少增加 1.5 倍。Ascend 970 计划在 2028 年四季度推出。大家届时可以期待它的惊人表现。",{"type":18,"tag":19,"props":3014,"children":3015},{},[3016],{"type":131,"value":3017},"这是刚才介绍的昇腾芯片的主要具体规格和路标，总体上，我们将以几乎一年一代算力翻倍的速度，同时围绕更易用，更多数据格式、更高带宽等方向持续演进，持续满足 AI 算力不断增长的需求。可以看到，相比 Ascend 910B\u002F910C，从 Ascend 950 开始的主要变化包括：",{"type":18,"tag":605,"props":3019,"children":3020},{},[3021,3026,3031,3036,3041],{"type":18,"tag":609,"props":3022,"children":3023},{},[3024],{"type":131,"value":3025},"引入 SIMD\u002FSIMT 新同构，提升编程易用性；",{"type":18,"tag":609,"props":3027,"children":3028},{},[3029],{"type":131,"value":3030},"支持更加丰富的数据格式，包括 FP32 \u002FHF32 \u002FFP16\u002FBF16\u002FFP8\u002FMXFP8\u002FHiF8\u002FMXFP4\u002FHiF4 等；",{"type":18,"tag":609,"props":3032,"children":3033},{},[3034],{"type":131,"value":3035},"支持更大的互联带宽，其中 950 系列为 2TB\u002Fs，970 系列提升到 4TB\u002Fs；",{"type":18,"tag":609,"props":3037,"children":3038},{},[3039],{"type":131,"value":3040},"支持更大的算力，FP8 算力从 950 系列的 1 PFLOPS 提升到 960 的 2 PFLOPS、970 的 4 PFLOPS；FP4 算力从 950 的 2 PFLOPS 提升到 960 的 4 PFLOPS、970 的 8 PFLOPS；",{"type":18,"tag":609,"props":3042,"children":3043},{},[3044],{"type":131,"value":3045},"内存容量逐渐加倍，而内存访问带宽将翻两番。",{"type":18,"tag":19,"props":3047,"children":3048},{},[3049],{"type":131,"value":3050},"有了昇腾芯片为基础，我们就能够打造满足客户需求的算力解决方案。从大型 AI 算力基础设施建设的技术方向看，超节点已经成为主导性产品形态，并正在成为 AI 基础设施建设的新常态。超节点事实上就是一台能学习、思考、推理的计算机，物理上由多台机器组成，但逻辑上以一台机器学习、思考、推理。随着算力需求的持续增长，超节点的规模也在持续、快速增大。",{"type":18,"tag":19,"props":3052,"children":3053},{},[3054],{"type":131,"value":3055},"今年 3 月份，华为正式推出了 Atlas 900 超节点，满配支持 384 卡。因为是超节点，这 384 颗 Ascend 910C 芯片，能够像一台计算机一样工作，最大算力可达 300 PFLOPS。到目前为止，Atlas 900 依然是全球算力最大的超节点。大家经常听到的 CloudMatrix384 超节点，是华为云基于 Atlas 900 超节点构建的云服务实例。Atlas 900 超节点自上市以来，已经累计部署超过 300 套，服务 20 多个客户，涵盖互联网、电信、制造等多个行业。可以说，Atlas 900 于 2025 年，开启了华为 AI 超节点的征程。",{"type":18,"tag":19,"props":3057,"children":3058},{},[3059],{"type":131,"value":3060},"今天，结合我们已经推出或正在研发中的昇腾芯片，我将为大家带来更多超节点和集群产品。现在进入今天最激动人心的时刻，就是新产品发布环节。",{"type":18,"tag":19,"props":3062,"children":3063},{},[3064,3066,3071],{"type":131,"value":3065},"今天我要发布的第一款产品，",{"type":18,"tag":181,"props":3067,"children":3068},{},[3069],{"type":131,"value":3070},"Atlas 950 超节点",{"type":131,"value":3072},"，基于 Ascend 950DT 打造。",{"type":18,"tag":605,"props":3074,"children":3075},{},[3076,3081,3086],{"type":18,"tag":609,"props":3077,"children":3078},{},[3079],{"type":131,"value":3080},"Atlas 950 超节点支持 8192 张基于 Ascend 950DT 的昇腾卡，是 Atlas 900 超节点的 20 多倍，我们习惯称呼的昇腾卡，每张卡对应一颗 Ascend 950DT 芯片，8192 张昇腾卡等同于 8192 颗 Ascend 950DT 芯片。",{"type":18,"tag":609,"props":3082,"children":3083},{},[3084],{"type":131,"value":3085},"Atlas 950 超节点满配包括由 128 个计算柜、32 个互联柜，共计 160 个机柜组成，占地面积 1000 平方米左右，柜间采用全光互联。总算力大幅度提升，其中，FP8 算力达到 8E FLOPS，FP4 算力达到 16E FLOPS。互联带宽达到 16PB\u002Fs，这个数字意味着，Atlas 950 一个产品的总互联带宽，已经超过今天全球互联网峰值带宽的 10 倍有余。",{"type":18,"tag":609,"props":3087,"children":3088},{},[3089],{"type":131,"value":3090},"Atlas 950 超节点的上市时间是：2026 年四季度。",{"type":18,"tag":19,"props":3092,"children":3093},{},[3094],{"type":131,"value":3095},"我们很自豪的看到，Atlas 950 超节点，至少在未来多年都将保持是全球最强算力的超节点，并且在各项主要能力上都远超业界主要产品。其中，相比英伟达同样将在明年下半年上市的 NVL144，Atlas 950 超节点卡的规模是其 56.8 倍，总算力是其 6.7 倍，内存容量是其 15 倍，达到 1152TB；互联带宽是其 62 倍，达到 16.3PB\u002Fs。即使是与英伟达计划 2027 年上市的 NVL576 相比，Atlas 950 超节点在各方面依然是领先的。",{"type":18,"tag":19,"props":3097,"children":3098},{},[3099],{"type":131,"value":3100},"算力、内存容量、内存访问速度、互联带宽等能力的大幅度增强，为大模型训练性能和推理吞吐带来显著提升。相比华为已经推出的 Atlas 900 超节点，Atlas 950 超节点的训练性能提升 17 倍，达到 4.91M TPS。通过支持 FP4 数据格式，Atlas 950 超节点的推理性能提升达 26.5 倍，达到 19.6M TPS。",{"type":18,"tag":19,"props":3102,"children":3103},{},[3104,3106,3111],{"type":131,"value":3105},"8192 卡超节点并不是我们的终点，我们还在继续努力。我今天发布的第二款超节点产品，",{"type":18,"tag":181,"props":3107,"children":3108},{},[3109],{"type":131,"value":3110},"Atlas 960 超节点",{"type":131,"value":3112},"。基于 Ascend 960，Atlas 960 超节点最大可支持 15488 卡。Atlas 960 超节点 由 176 个计算柜，44 个互联柜，共 220 个机柜，占地面积约 2200 平方米。",{"type":18,"tag":19,"props":3114,"children":3115},{},[3116],{"type":131,"value":3117},"Atlas 960 超节点的上市时间是：2027 年四季度。",{"type":18,"tag":19,"props":3119,"children":3120},{},[3121],{"type":131,"value":3122},"伴随卡的规模的再次升级，Atlas 960 超节点让我们在 AI 超节点的优势再度增强。基于 Ascend 960，其总算力、内存容量、互联带宽在 Atlas 950 基础上再翻倍。其中，FP8 总算力将达到 30E FLOPS，而 FP4 总算力将达到 60 EFLOPS；内存容量达到 4460TB，互联带宽达到 34PB\u002Fs。大模型训练和推理的性能相比 Atlas 950 超节点，将分别提升 3 倍和 4 倍以上，达到 15.9M TPS 和 80.5M TPS。通过 Atlas 950 和 Atlas 960，我们对于为人工智能的长期快速发展提供可持续且充裕算力，充满信心。",{"type":18,"tag":19,"props":3124,"children":3125},{},[3126],{"type":131,"value":3127},"超节点已经重新定义 AI 基础设施的范式，但不仅仅局限于 AI。在通用计算领域，我们同样认为，超节点技术能够带来很大的价值。从需求角度考虑，金融核心业务等目前仍然有部分承载在大型机和小型机之上，相比普通服务器集群，它们对服务器的性能和可靠性有更高的诉求，通用计算超节点在这两点上正好切合需求。从技术角度考虑，超节点同样可以为通算领域注入全新活力。",{"type":18,"tag":19,"props":3129,"children":3130},{},[3131],{"type":131,"value":3132},"因此，鲲鹏处理器主要围绕支持超节点，更多核、更高性能等方向持续演进。同时，通过自研的双线程灵犀核，使鲲鹏处理器能方便支持更多线程。",{"type":18,"tag":19,"props":3134,"children":3135},{},[3136],{"type":131,"value":3137},"2026 年 Q1，我们将推出 Kunpeng 950 处理器，包括两个版本，分别是：96 核\u002F192 线程和 192 核\u002F384 线程；支持通用计算超节点；安全方面新增四层隔离，成为鲲鹏首颗实现机密计算的数据中心处理器。",{"type":18,"tag":19,"props":3139,"children":3140},{},[3141],{"type":131,"value":3142},"2028 年 Q1，鲲鹏处理器将在芯片微架构、先进封装技术等领域持续突破关键技术，将再次推出两个版本，分别是高性能版本，96 核\u002F192 线程，单核性能提升 50%+，主要面向 AI host、数据库等场景。以及高密版本，不少于 256 核\u002F512 线程，主要面向虚拟化、容器、大数据、数仓等场景。",{"type":18,"tag":19,"props":3144,"children":3145},{},[3146,3148,3153],{"type":131,"value":3147},"接下来是今天我发布的第三款产品：",{"type":18,"tag":181,"props":3149,"children":3150},{},[3151],{"type":131,"value":3152},"TaiShan 950 超节点",{"type":131,"value":3154},"，基于 Kunpeng 950 打造，全球首个通用计算超节点，其最大支持 16 节点，32 个处理器，最大内存 48TB，同时支持内存、SSD、DPU 池化。",{"type":18,"tag":19,"props":3156,"children":3157},{},[3158],{"type":131,"value":3159},"这款产品不只是通用计算领域的一次技术升级，除了大幅提升通用计算场景下的业务性能，还能帮助金融系统破解核心难题。当前大型机、小型机替换的核心挑战是数据库分布式改造，而基于 TaiShan 950 超节点打造的 GaussDB 多写架构，无需改造，但性能提升 2.9 倍，最终可平滑替代大型机、小型机上的传统数据库。TaiShan 950 加上分布式 GaussDB 将成为各类大型机、小型机的终结者，彻底取代各种应用场景的大型机和小型机以及 Oracle 的 Exadata 数据库服务器。",{"type":18,"tag":19,"props":3161,"children":3162},{},[3163],{"type":131,"value":3164},"除了核心数据库场景，TaiShan 950 超节点在更广泛的场景里，表现也很亮眼：比如虚拟化环境的内存利用率提升 20%，在 Spark 大数据场景，实时数据处理时间缩短 30%。",{"type":18,"tag":19,"props":3166,"children":3167},{},[3168],{"type":131,"value":3169},"TaiShan 950 超节点上市时间是：2026 年一季度，敬请期待。",{"type":18,"tag":19,"props":3171,"children":3172},{},[3173],{"type":131,"value":3174},"超节点的价值，不仅仅体现在智算和通算传统业务领域。互联网产业广泛应用的推荐系统，正在从传统推荐算法向生成式推荐系统演进。我们可以基于 TaiShan 950 和 Atlas 950 打造成混合超节点，为下一代生成式推荐系统打开全新架构方向。",{"type":18,"tag":19,"props":3176,"children":3177},{},[3178],{"type":131,"value":3179},"一方面，通过超大带宽、超低时延互联以及超大内存，混合超节点构成超大共享内存池，支持 PB 级推荐系统嵌入表，从而支撑超高维度用户特征；另一方面，混合超节点的超大 AI 算力，能够支持超低时延推理和特征检索。因此，混合超节点是面向下一代生成式推荐系统的解决方案的全新选择。",{"type":18,"tag":19,"props":3181,"children":3182},{},[3183],{"type":131,"value":3184},"大规模超节点把智算和通算的能力都推向新的高度，同时也对互联技术提出了重大挑战。华为作为联接领域的领导者，当然不惧挑战。在定义和设计 Atlas 950、Atlas 960 两个超节点的技术规格时，我们遭遇到了互联技术的巨大挑战，主要在两个方面：",{"type":18,"tag":605,"props":3186,"children":3187},{},[3188,3193],{"type":18,"tag":609,"props":3189,"children":3190},{},[3191],{"type":131,"value":3192},"第一是如何做到长距离而且高可靠。大规模超节点机柜多，柜间联接距离长，当前电互联和光互联技术都不能满足需求。其中，当前的电互联技术在高速时联接距离短，最多只能支持两柜互联，而当前的光互联技术虽然可以把长距离的多机柜联接在一起，但无法满足可靠性需求。",{"type":18,"tag":609,"props":3194,"children":3195},{},[3196],{"type":131,"value":3197},"第二是如何做到大带宽而且低时延。当前跨柜卡间互联带宽低，和超节点的需求差距达 5 倍；跨柜的卡间时延大，当前互联技术最好只能做到 3 微秒左右，和 Atlas 950\u002F960 设计需求仍然有 24%的差距，当时延已经低至 2~3 个微秒时，已经逼近物理极限，哪怕 0.1 微秒的提升，挑战都很大。",{"type":18,"tag":19,"props":3199,"children":3200},{},[3201],{"type":131,"value":3202},"华为基于三十多年构筑的技术能力，通过系统性创新，彻底解决了当前技术存在的问题，超标达成 Atlas 950\u002F960 超节点的设计需求，使万卡超节点成为可能。",{"type":18,"tag":19,"props":3204,"children":3205},{},[3206],{"type":131,"value":3207},"首先，为了解决长距离且高可靠问题，我们在互联协议的物理层、数据链路层、网络层、传输层等每一层都引入了高可靠机制；同时在光路引入了百纳秒级故障检测和保护切换，当出现光模块闪断或故障时，让应用无感；并且，我们重新定义和设计了光器件、光模块和互联芯片。这些创新和设计让光互联的可靠性提升 100 倍，且互联距离超过 200 米，实现了电的可靠和光的距离。",{"type":18,"tag":19,"props":3209,"children":3210},{},[3211],{"type":131,"value":3212},"其次，为了解决大带宽且低时延问题，我们突破了多端口聚合与高密封装技术，以及平等架构和统一协议，实现了 TB 级的超大带宽，2.1 微秒的超低时延。正是因为一系列系统性、原创性的技术创新，我们才攻克了超节点互联技术，满足了高可靠、全光互联、高带宽、低时延的互联要求，让大规模超节点成为了可能。",{"type":18,"tag":19,"props":3214,"children":3215},{},[3216],{"type":131,"value":3217},"为了达成 Atlas 950\u002F960 超节点对互联的技术要求，为了实现万卡超节点还能是一台计算机，华为开创了超节点架构并开创了新型的互联协议，能够支撑万卡级超节点架构。基于这个互联协议的超节点架构的核心价值主张是：万卡超节点，一台计算机，也就是说，通过该互联协议，把数万规模的计算卡，联接成一个超节点，能够像一台计算机一样工作、学习、思考、推理。",{"type":18,"tag":19,"props":3219,"children":3220},{},[3221],{"type":131,"value":3222},"在技术上，我们总结认为，万卡级超节点架构应该具备 6 大特征，分别是总线级互联、平等协同、全量池化、协议归一、大规模组网、高可用性。我们为这个面向超节点的新型互联协议取名“灵衢”，英文名称：UB，UnifiedBus",{"type":18,"tag":19,"props":3224,"children":3225},{},[3226,3228,3233],{"type":131,"value":3227},"今天，我们",{"type":18,"tag":181,"props":3229,"children":3230},{},[3231],{"type":131,"value":3232},"正式发布灵衢、UnifiedBus，一个面向超节点的互联协议",{"type":131,"value":1381},{"type":18,"tag":19,"props":3235,"children":3236},{},[3237],{"type":131,"value":3238},"同时，我宣布，华为将开放灵衢 2.0 技术规范。为什么从灵衢 2.0 开始开放？事实上，灵衢的研究是从 2019 年开始的，因为众所周知的原因，先进工艺不可获得，我们需要从多芯片上突破，希望把更多的计算资源联接在一起。我们取了一个名字叫 UnifiedBus，简称 UB，中文名字“灵衢”，意味着类似九省通衢，实现大规模算力的联通。基于灵衢  1.0 的 Atlas 900 超节点自 2025 年 3 月开始交付，至今已商用部署 300 多套，灵衢 1.0 技术得到充分验证。在灵衢 1.0 的基础上，我们继续丰富功能，优化性能，提升规模，进一步完善了协议，形成了灵衢 2.0，前面发布的 Atlas 950 超节点就是基于灵衢 2.0。",{"type":18,"tag":19,"props":3240,"children":3241},{},[3242],{"type":131,"value":3243},"我们认为灵衢 2.0 具备了开放的条件，为了更广泛地促进互联技术发展和产业进步，今天华为决定开放灵衢 2.0 技术规范，欢迎产业界伙伴基于灵衢研发相关产品和部件，共建灵衢开放生态。",{"type":18,"tag":19,"props":3245,"children":3246},{},[3247],{"type":131,"value":3248},"我在去年 HC 会上强调过，基于中国可获得的芯片制造工艺，我们努力打造“超节点+集群”算力解决方案，来持续满足算力需求。今天已经介绍了三个超节点产品。灵衢既为超节点而生，是面向超节点的互联协议，也是构建算力集群产品最优的互联技术。",{"type":18,"tag":19,"props":3250,"children":3251},{},[3252,3254,3259],{"type":131,"value":3253},"接下来为大家带来两个集群产品：首先是，",{"type":18,"tag":181,"props":3255,"children":3256},{},[3257],{"type":131,"value":3258},"Atlas 950 SuperCluster 50 万卡集群",{"type":131,"value":3260},"！",{"type":18,"tag":19,"props":3262,"children":3263},{},[3264],{"type":131,"value":3265},"Atlas 950 SuperCluster 集群由 64 个 Atlas 950 超节点互联组成，把 1 万多机柜中的 52 万多片昇腾 950DT 组成为一个整体，FP8 总算力可达 524 EFLOPS。上市时间与 Atlas 950 超节点同步，即 2026 年 Q4。",{"type":18,"tag":19,"props":3267,"children":3268},{},[3269],{"type":131,"value":3270},"在集群组网上，我们同时支持 UBoE 与 RoCE 两种协议，UBoE 是把 UB 协议承载在以太网上，让客户能够利用现有以太交换机。相比传统 RoCE，UBoE 组网的静态时延更低、可靠性更高，交换机和光模块数量都更节省，所以，我们推荐 UBoE。",{"type":18,"tag":19,"props":3272,"children":3273},{},[3274],{"type":131,"value":3275},"这就是我们的 Atlas 950 SuperCluster 集群。相比当前世界上最大的集群 xAI Colossus，规模是其 2.5 倍，算力是其 1.3 倍，是当之无愧的全世界最强算力集群！无论是当下主流的千亿稠密、稀疏大模型训练任务，还是未来的万亿、十万亿大模型训练，超节点集群都可以成为性能强悍的算力底座，高效稳定地支持人工智能持续创新。",{"type":18,"tag":19,"props":3277,"children":3278},{},[3279,3281,3286],{"type":131,"value":3280},"相应的，在 2027 年 Q4，我们还将基于 Atlas 960 超节点，同步推出",{"type":18,"tag":181,"props":3282,"children":3283},{},[3284],{"type":131,"value":3285},"Atlas 960 SuperCluster",{"type":131,"value":3287},"，集群规模进一步提升到百万卡级，FP8 总算力达到 2 ZFLOPS！FP4 总算力达到 4 ZFLOPS。并且，它同样也支持 UBoE 与 RoCE 两种协议，在 UBoE 协议加持下，性能与可靠性同样更优，并且，静态时延和网络无故障时间优势进一步扩大，因此继续推荐 UBoE 组网。通过 Atlas 960 SuperCluster，我们将持续加速客户应用创新，探索智能水平新高。",{"type":18,"tag":19,"props":3289,"children":3290},{},[3291],{"type":131,"value":3292},"很高兴今天给大家带来一系列新产品，我们希望和产业界一起，以开创的灵衢超节点互联技术，引领 AI 基础设施新范式；以基于灵衢的超节点和集群持续满足算力快速增长的需求，推动人工智能持续发展，创造更大的价值，谢谢！",{"type":18,"tag":19,"props":3294,"children":3295},{},[3296,3298],{"type":131,"value":3297},"2025 年 9 月 18-20 日，第十届华为全联接大会在上海世博展览馆及世博中心举办。本届大会以“跃升行业智能化”为主题，通过“战略全景-产业技术-生态发展”的三维视角，阐释华为全面智能化战略的最新举措，并发布全新的数智基础设施产品、行业场景化解决方案、开发工具等。欲了解更多详情，请参阅华为全联接大会官网：",{"type":18,"tag":134,"props":3299,"children":3302},{"href":3300,"rel":3301},"https:\u002F\u002Fwww.huawei.com\u002Fcn\u002Fevents\u002Fhuaweiconnect",[138],[3303],{"type":131,"value":3300},{"title":8,"searchDepth":28,"depth":28,"links":3305},[],"content:zh:news:hc-xu-keynote-speech.md","zh\u002Fnews\u002Fhc-xu-keynote-speech.md","zh\u002Fnews\u002Fhc-xu-keynote-speech",{"_path":3310,"_dir":6,"_draft":7,"_partial":7,"_locale":8,"title":3311,"description":3312,"date":3313,"cover":3314,"type":6,"body":3315,"_type":30,"_id":3480,"_source":32,"_file":3481,"_stem":3482,"_extension":35},"\u002Fzh\u002Fnews\u002Fhc-superpod-innovation","超节点架构创新，开源开放共筑全场景算力底座","在华为全联接大会2025期间，华为董事、ICT BG CEO杨超斌发表了“超节点架构创新，开源开放共筑全场景算力底座”的主题演讲，宣布推出创新的超节点架构，发布标卡、模组、服务器、集群等多款最新的超节点产品，与产业界共筑坚实全场景算力底座。","2025\u002F09\u002F18 17:20","\u002Fcategory\u002Fnews\u002F2025-09-18\u002F20250918-hc-ycb-2.jpg",{"type":15,"children":3316,"toc":3478},[3317,3322,3327,3344,3352,3357,3362,3367,3372,3395,3410,3433,3441,3446,3454,3459,3464,3469],{"type":18,"tag":19,"props":3318,"children":3319},{},[3320],{"type":131,"value":3321},"[中国，上海，2025 年 9 月 18 日] 在华为全联接大会 2025 期间，华为董事、ICT BG CEO 杨超斌发表了“超节点架构创新，开源开放共筑全场景算力底座”的主题演讲，宣布推出创新的超节点架构，发布标卡、模组、服务器、集群等多款最新的超节点产品，与产业界共筑坚实全场景算力底座。",{"type":18,"tag":19,"props":3323,"children":3324},{},[3325],{"type":131,"value":3326},"杨超斌表示：“基于灵衢互联协议，华为开创了超节点架构，可将多台物理机器深度互联，实现逻辑层面像一台机器一样学习、思考与推理，重新定义了高效、稳定、可扩展的大规模有效算力新范式。昇腾围绕超节点架构持续创新，打造全系列超节点产品，满足大型数据中心、企业级数据中心和小型工作站等全场景算力需求，让超节点技术惠及每个行业。同时，华为坚持硬件开放、软件开源，支持伙伴打造面向行业的超节点场景化解决方案，加速开发者高效自主创新，共建繁荣生态。”",{"type":18,"tag":387,"props":3328,"children":3330},{"style":3329},"text-align: center;margin:24px auto;",[3331,3339],{"type":18,"tag":19,"props":3332,"children":3333},{},[3334],{"type":18,"tag":23,"props":3335,"children":3338},{"alt":3336,"src":3337},"Yang chaobing","\u002Fcategory\u002Fnews\u002F2025-09-18\u002F250918-03.jpg",[],{"type":18,"tag":19,"props":3340,"children":3341},{},[3342],{"type":131,"value":3343},"华为董事、ICT BG CEO 杨超斌发表主题演讲",{"type":18,"tag":19,"props":3345,"children":3346},{},[3347],{"type":18,"tag":181,"props":3348,"children":3349},{},[3350],{"type":131,"value":3351},"开创超节点架构，释放集群规模算力的潜能",{"type":18,"tag":19,"props":3353,"children":3354},{},[3355],{"type":131,"value":3356},"AI 技术与应用快速迭代演进，对算力有效性和时延的要求不断提升。传统服务器堆叠的模式，可能带来集群规模越大，算力利用率越低，训练中断越频繁的困境。",{"type":18,"tag":19,"props":3358,"children":3359},{},[3360],{"type":131,"value":3361},"依托灵衢，华为开创的超节点架构具备资源池化、规模扩展、长稳可靠的关键特性，可实现计算、存储单元的大带宽和低时延互联，通过统一协议和内存编址，使有效算力能够随集群规模线性扩展，并大幅提升集群可靠性。",{"type":18,"tag":19,"props":3363,"children":3364},{},[3365],{"type":131,"value":3366},"今年，华为已经推出了 Atlas 900 A3 SuperPoD 超节点，至今累计部署 300 多套，服务于互联网、金融、运营商、电力、制造等行业的 20 多个客户。",{"type":18,"tag":19,"props":3368,"children":3369},{},[3370],{"type":131,"value":3371},"本次大会，华为推出基于灵衢和超节点架构的全新产品，包括全液冷数据中心 AI 超节点 Atlas 950 SuperPoD、企业级风冷 AI 超节点服务器 Atlas 850 和 Atlas 860、AI 新一代标卡 Atlas 350、业界首个通算超节点 TaiShan 950 SuperPoD 等。",{"type":18,"tag":605,"props":3373,"children":3374},{},[3375,3385],{"type":18,"tag":609,"props":3376,"children":3377},{},[3378,3383],{"type":18,"tag":181,"props":3379,"children":3380},{},[3381],{"type":131,"value":3382},"Atlas 950 SuperPoD",{"type":131,"value":3384},"，是面向超大型 AI 计算任务的最佳选择，从基础器件、协议算法到光电技术，实现系统级创新突破。通过正交架构，Atlas 950 实现零线缆电互联，采用液冷接头浮动盲插设计做到零漏液，其独创的材料和工艺让光模块液冷可靠性提升一倍。其创新的 UB-Mesh 递归直连拓扑网络架构，支持单板内、单板间和机架间的 NPU 全互联，以 64 卡为步长按需扩展，最大可实现 8192 卡无收敛全互联。",{"type":18,"tag":609,"props":3386,"children":3387},{},[3388,3393],{"type":18,"tag":181,"props":3389,"children":3390},{},[3391],{"type":131,"value":3392},"Atlas 850",{"type":131,"value":3394},"，是业界首个企业级风冷 AI 超节点服务器，内部搭载 8 张昇腾 NPU，有效满足企业模型后训练、多场景推理等需求。Atlas 850 支持多柜灵活部署，最大可形成 128 台 1024 卡的超节点集群，是目前业内唯一可在风冷机房实现超节点架构的算力集群。",{"type":18,"tag":387,"props":3396,"children":3397},{"style":3329},[3398,3405],{"type":18,"tag":19,"props":3399,"children":3400},{},[3401],{"type":18,"tag":23,"props":3402,"children":3404},{"alt":3403,"src":3314},"250918-03",[],{"type":18,"tag":19,"props":3406,"children":3407},{},[3408],{"type":131,"value":3409},"杨超斌发布 Atlas 850 企业级风冷 AI 超节点服务器",{"type":18,"tag":605,"props":3411,"children":3412},{},[3413,3423],{"type":18,"tag":609,"props":3414,"children":3415},{},[3416,3421],{"type":18,"tag":181,"props":3417,"children":3418},{},[3419],{"type":131,"value":3420},"Atlas 350 标卡",{"type":131,"value":3422},"，采用最新的昇腾 950PR 芯片，向量算力提升 2 倍，支持更细粒度的 Cacheline 访问，在推荐推理场景可实现 2.5 倍性能提升，且单卡即可运行。Atlas 350 支持 4 个灵衢端口互联，实现算力、内存等资源池化，让更大参数模型、更低时延应用可以在标卡上实现。",{"type":18,"tag":609,"props":3424,"children":3425},{},[3426,3431],{"type":18,"tag":181,"props":3427,"children":3428},{},[3429],{"type":131,"value":3430},"TaiShan 950 SuperPoD",{"type":131,"value":3432},"，是华为推出的业界首款通算超节点，具备 370 纳秒超低时延、2.8T 超大带宽和内存池化能力，能大幅提升数据库、虚机热迁移和大数据场景等业务性能，为通算性能提升开辟全新路径。",{"type":18,"tag":19,"props":3434,"children":3435},{},[3436],{"type":18,"tag":181,"props":3437,"children":3438},{},[3439],{"type":131,"value":3440},"硬件开放，助力伙伴打造超节点场景化方案",{"type":18,"tag":19,"props":3442,"children":3443},{},[3444],{"type":131,"value":3445},"华为全面开放超节点技术，与产业界共享技术红利，共同推动超节点技术走向普惠与协同创新。首先，开放灵衢协议和超节点参考架构，允许产业界基于技术规范自研相关产品或部件。其次，全面开放超节点基础硬件，包括 NPU 模组、风冷刀片、液冷刀片、AI 标卡、CPU 主板和级联卡等不同形态的硬件，方便客户和伙伴进行增量开发，设计基于灵衢的各种产品。",{"type":18,"tag":19,"props":3447,"children":3448},{},[3449],{"type":18,"tag":181,"props":3450,"children":3451},{},[3452],{"type":131,"value":3453},"软件开源，加速开发者灵活高效创新",{"type":18,"tag":19,"props":3455,"children":3456},{},[3457],{"type":131,"value":3458},"超节点的运行离不开操作系统的深度支持。操作系统灵衢组件也将全部开源，组件代码将陆续合入 openEuler 等多个上游操作系统开源社区。用户可以根据实际需求，将部分或全部源代码集成到现有操作系统中，自行迭代维护版本，也可以将整个组件直接合入现有操作系统，未来演进与开源社区版本同步。",{"type":18,"tag":19,"props":3460,"children":3461},{},[3462],{"type":131,"value":3463},"开源是驱动技术创新和产业进步的核心力量。昇腾 CANN 全面开源开放，Mind 系列组件也同步开源，并优先支持 PyTorch、vLLM 等业界开源社区，加速开发者自主创新。",{"type":18,"tag":19,"props":3465,"children":3466},{},[3467],{"type":131,"value":3468},"智能化的浪潮正以前所未有的力量重塑千行万业。华为始终坚持技术创新、开放共享，携手客户和伙伴，共筑坚实的全场景算力底座，共赢智能时代。",{"type":18,"tag":19,"props":3470,"children":3471},{},[3472,3473],{"type":131,"value":3297},{"type":18,"tag":134,"props":3474,"children":3476},{"href":3300,"rel":3475},[138],[3477],{"type":131,"value":3300},{"title":8,"searchDepth":28,"depth":28,"links":3479},[],"content:zh:news:hc-superpod-innovation.md","zh\u002Fnews\u002Fhc-superpod-innovation.md","zh\u002Fnews\u002Fhc-superpod-innovation",{"_path":3484,"_dir":6,"_draft":7,"_partial":7,"_locale":8,"title":3485,"description":3486,"date":3487,"cover":2837,"type":6,"body":3488,"_type":30,"_id":3547,"_source":32,"_file":3548,"_stem":3549,"_extension":35},"\u002Fzh\u002Fnews\u002Fhc-lingqu-ai-superpod","华为发布全球最强算力超节点和集群","今日，华为全联接大会2025在上海启幕，华为副董事长、轮值董事长徐直军发表题为“以开创的超节点互联技术，引领AI基础设施新范式”的主题演讲，正式发布全球最强算力超节点和集群。","2025\u002F09\u002F18 17:10",{"type":15,"children":3489,"toc":3545},[3490,3495,3506,3511,3516,3521,3526,3531,3536],{"type":18,"tag":19,"props":3491,"children":3492},{},[3493],{"type":131,"value":3494},"[中国，上海，2025 年 9 月 18 日]　今日，华为全联接大会 2025 在上海启幕，华为副董事长、轮值董事长徐直军发表题为“以开创的超节点互联技术，引领 AI 基础设施新范式”的主题演讲，正式发布全球最强算力超节点和集群。",{"type":18,"tag":387,"props":3496,"children":3497},{"style":3329},[3498,3502],{"type":18,"tag":23,"props":3499,"children":3501},{"src":2837,"alt":3500},"华为轮值董事长徐直军发表主题演讲",[],{"type":18,"tag":19,"props":3503,"children":3504},{},[3505],{"type":131,"value":3500},{"type":18,"tag":19,"props":3507,"children":3508},{},[3509],{"type":131,"value":3510},"徐直军指出：“算力过去是，未来也将继续是人工智能的关键，更是中国人工智能的关键，”并再次强调：“基于中国可获得的芯片制造工艺，华为努力打造‘超节点+集群’算力解决方案，来满足持续增长的算力需求。”",{"type":18,"tag":19,"props":3512,"children":3513},{},[3514],{"type":131,"value":3515},"徐直军认为，超节点在物理上由多台机器组成，但逻辑上以一台机器学习、思考、推理。华为发布了最新超节点产品 Atlas 950 SuperPoD 和 Atlas 960 SuperPoD 超节点，分别支持 8192 及 15488 张昇腾卡，在卡规模、总算力、内存容量、互联带宽等关键指标上全面领先，在未来多年都将是全球最强算力的超节点。基于超节点，华为同时发布了全球最强超节点集群，分别是 Atlas 950 SuperCluster 和 Atlas 960 SuperCluster，算力规模分别超过 50 万卡和达到百万卡，是当之无愧的全世界最强算力集群。",{"type":18,"tag":19,"props":3517,"children":3518},{},[3519],{"type":131,"value":3520},"徐直军表示，基于全球最强算力的超节点和集群，华为对于为人工智能的长期快速发展提供可持续且充裕算力，充满信心。",{"type":18,"tag":19,"props":3522,"children":3523},{},[3524],{"type":131,"value":3525},"同时，华为率先把超节点技术引入通用计算领域，发布全球首个通用计算超节点 TaiShan 950 SuperPoD，结合 GaussDB 分布式数据库，能够彻底取代各种应用场景的大型机和小型机以及 Exadata 数据库一体机，将成为各类大型机、小型机的终结者。",{"type":18,"tag":19,"props":3527,"children":3528},{},[3529],{"type":131,"value":3530},"华为基于三十多年构筑的联接技术能力，通过系统性创新，突破了大规模超节点的互联技术巨大挑战，开创了面向超节点的互联协议灵衢（UnifiedBus），徐直军宣布华为将开放灵衢 2.0 技术规范，欢迎产业界伙伴基于灵衢研发相关产品和部件，共建灵衢开放生态。",{"type":18,"tag":19,"props":3532,"children":3533},{},[3534],{"type":131,"value":3535},"徐直军强调：“华为将以基于灵衢的超节点和集群持续满足算力快速增长的需求，推动人工智能持续发展，创造更大的价值。”",{"type":18,"tag":19,"props":3537,"children":3538},{},[3539,3540],{"type":131,"value":3297},{"type":18,"tag":134,"props":3541,"children":3543},{"href":3300,"rel":3542},[138],[3544],{"type":131,"value":3300},{"title":8,"searchDepth":28,"depth":28,"links":3546},[],"content:zh:news:hc-lingqu-ai-superpod.md","zh\u002Fnews\u002Fhc-lingqu-ai-superpod.md","zh\u002Fnews\u002Fhc-lingqu-ai-superpod",1787024204476]