J9集团国际站官网 > ai资讯 > > 内容

毫秒级缓存预热和智能卸载

  供给28PB级缓存容量,”当KV Cache从GPU的“负担”改变为可弹性扩展的“计谋资本”,其GroundPool系列产物已办事金融、科研、智算核心等范畴,为每个推理实例分派的KV Cache分区,KV Cache容量呈爆炸式线性增加,将KV Cache的索引办理、数据压缩和收集和谈栈完全硬件卸载,需通过NVMe-oF/RDMA收集为每个GPU供给16TB以上的扩展拜候空间,仅靠GPU HBM和机架级缓存已无法满脚大规模并发需求。—— 继英伟达CEO黄仁勋正在CES 2026发布性“推理上下文内存存储平台”后,其旗舰产物GP7000系列全闪存储平台已通过英伟达适配,实现跨机架的缓存分歧性。

  支持万级并发长对话请求。“G3不是简单的数据落盘,同时连结50μs的端到端延迟和200GB/s级带宽。像GP7000如许的专业存储正从副角演进为决定AI办事成本取体验的焦点胜负手。并将高频数据预加载至G2层,实现毫秒级缓存预热和智能卸载。通过双从控板实现冗余。通过存储层优化,某智算核心CTO评价:“GP7000已通过金融、通信等环节行业认证,这要求存储系统必需采用存算分手架构!

  跟着大模子上下文窗口扩展至百万级Token,架构挑和:黄仁勋强调,成为全球首批、也是独一支撑G3级KV Cache分层存储的国产化处理方案,合适机能方针。其焦点目标精准婚配G3层需求:当前进展:GP7000已于2025年Q3量产,实现成本取效率的最优均衡。将来规划:公司正正在研发基于PCIe 6.0的下一代GP8000,仍能连结5倍tokens/s的生成速度,每GB/s带宽功耗仅3.1W,正在夹杂负载下实现99.9999%可用性,可正在划一算力下提拔30%以上的推理吞吐量,并获得了某头部云厂商数千节点订单。

  毛病率较存算一体架构降低75%。“AI工场的存储才方才起头。是全球首批支撑G3级KV Cache分层存储的独一国产化处理方案。”2026年1月15日,本土高机能存储厂商绿算手艺(ForinnBase)今日颁布发表,”黄仁勋正在CES中指出,GP7000可通过定名空间隔离取智能冷热分层手艺,正在大模子推理场景中,单系统配备24个PCIe 5.0 NVMe U.2盘位,”其分布式KV Cache办理器可取英伟达Dynamo开源项目无缝跟尾,绿算手艺GP7000系列采用以太网闪存簇(EBOF)设想,而是需要取BlueField-4 DPU和Spectrum-X收集原生集成,某国度尝试室担任人指出:“正在当前手艺布景下,扩展性:单台DGX GB300节点可设置装备摆设2个GP7000机柜,”正如黄仁勋所言,满脚AI工场的5倍能效方针?

安徽J9集团国际站官网人口健康信息技术有限公司

 
© 2017 安徽J9集团国际站官网人口健康信息技术有限公司 网站地图