中文科技资讯
业界资讯 互联网 手机资讯 电脑硬件 数码产品 家电产品 APP应用 手机游戏 美通快讯

华瑞指数云携手大普微亮相新加坡科技周,加速全球 AI 推理落地

2026-09-30来源:美通社编辑:

北京2026年9月30日 /美通社/ -- 2026 年 9 月 29 日—30 日,Tech Week Singapore(新加坡科技周)在新加坡滨海湾金沙会展中心盛大举办。华瑞指数云科技(深圳)有限公司(ExponTech)携手深圳大普微电子股份有限公司(DapuStor)联合参展,重点展出双方共同打造的 KVstor AI 原生一体机联合方案。这是华瑞指数云首次以"存储软件 + 企业级硬件"联合方案形态亮相东南亚市场,也标志着公司海外业务拓展进入加速阶段。本届大会由 CloserStill Media 主办,同期落地 Cloud & AI Infrastructure Asia、Big Data & AI World Asia、Data Centre World Asia、Cyber Security World Asia、DevOps Live Asia 五大专题展会,汇聚 29,000 余名亚太及全球技术决策者与 500 余家参展商,是观察亚太 AI 基础设施建设节奏与落地路径的重要窗口。为期两天的展会中,华瑞指数云与大普微的联合展台吸引了来自新加坡、马来西亚、印度尼西亚等国家和地区的行业用户、智算中心运营方与 AI 厂商驻足交流。


推理为王时代,"知力"成为 AI 落地新瓶颈

当下 AI 产业正从"训练竞赛"全面转向"推理为王"。头部大模型能力持续趋同、GPU 算力走向标准化,单纯依靠算力与模型构建产品壁垒的时代已然落幕,真正制约企业 AI 规模化落地的,是推理环节被反复浪费的算力:随着并发用户与上下文长度增长,KV Cache 对 GPU 显存(HBM)的占用急剧膨胀,显存不足时缓存被驱逐,未命中的 Token 只能消耗 GPU 算力重新计算,直接推高首 Token 时延(TTFT)、拉低整体吞吐。与此同时,企业生产数据、知识数据与推理上下文往往散落在多套存储系统中,割裂架构带来额外的数据搬运与运维成本。华瑞指数云认为,当算力趋同之后,决定 AI 智能上限的是"知力",即对全量上下文完成统一存储、全局共享、精准检索,并高效输送至 GPU 的底层能力。

KVstor 联合方案亮相,软硬协同破解推理核心瓶颈

本次展会华瑞指数云与大普微联合展出的 KVstor AI 原生数据一体机,是面向 AI 训练、大规模推理、企业 RAG 知识库及核心交易业务的一体化软硬融合解决方案,融合大普微全栈自研高性能企业级 SSD 硬件优势与华瑞指数云 WQS AI 原生 KV Cache 存储核心能力,可将高频 KV Cache 数据从昂贵的 GPU HBM 显存无缝卸载至分布式全闪存储池,构建全局共享的 KV 缓存资源池,一站式化解显存不足、KV Cache 重复计算、多场景存储割裂、推理成本居高不下等难题。


依托华瑞指数云全自研 WiDE 分布式引擎,KVstor 一套存储即可同时承载企业 OLTP 核心交易数据、海量非结构化业务文档、AI 训练数据集、RAG 向量知识库与推理 KV 缓存,无需跨系统迁移拷贝数据,从源头消除数据孤岛,大幅降低运维复杂度与整体建设成本;产品原生兼容 vLLM、SGLang、TRT-LLM、LMCache、Dynamo 及昇腾 MindIE 等国内外主流推理框架,并原生对接 NVIDIA CMX 分层缓存架构,集群支持 EB 级线性横向扩展,新增节点同步扩容容量与 IO 性能,端到端访问时延稳定控制在 200μs 以内。

以存代算,实测数据印证推理效率跃升

性能是这套联合方案最直接的竞争力。在面向长上下文的实验室极限场景测试中(DeepSeek-R1-0528 • 8×NVIDIA H20 • vLLM + LMCache • 100K token 输入),相较于 GPU 全量重算,接入KVstor后, 全量命中将 TTFT 从 323 秒压缩至 16 秒,提升达 20 倍;Token 吞吐量从 4,194 tok/s 提升至 90,000 tok/s,提升达 22 倍,端到端并发读取时延稳定控制在 200μs 以内。

在真实业务的高并发多轮 Agent 场景中(30K token 系统提示词 • 30—100 并发用户),该方案的价值更为可观:仅依赖 HBM 时,推理集群在 30 并发即触及"逐出悬崖",TTFT 劣化至近 400 秒;引入 KVstor 后,缓存命中率稳定维持 97% 以上,吞吐稳定提升 4.4—4.7 倍,TTFT 降低 76%—78%,在高并发压力下性能表现平稳可预期。在某头部银行面向生产等价硬件开展的严格 A/B 对比测试中(8×H20 • vLLM + LMCache • 3 节点 KVstor 全闪一体机 • 3600 秒压力测试),40 并发多轮对话场景的 TTFT 由 89 秒缩短至 19 秒,整体吞吐提升 4.5 倍,命中率保持 97% 以上,30—100 并发规模无性能衰减。


综合测算,KVstor 一体化方案可帮助用户节省 60% 以上的推理 GPU 硬件成本。以 SSD 存储替代昂贵 HBM 显存承载 KV Cache,单位容量成本约为 HBM 的 1/10,同时一个 WQS 存储节点即可提供约 3 台传统存储服务器的等效性能,让企业在不新增 GPU 的前提下大幅扩张推理服务产能——少买卡、多服务,显著降低 TCO 并提升投资回报。

AI 原生 KV Cache 存储,从底层重构推理数据通路

上述表现的底层支撑,是华瑞指数云 WQS 极速 AI 语义存储系统。与传统方案在文件系统之上"打补丁"的路径不同,WQS 从 KV Cache 的 IO 特征出发做全栈原生设计:通过"KV → 网络 → KV"原生路径实现仅 2 跳、0 次内核穿越的全用户态 RDMA 零拷贝传输,直管 NVMe 裸盘并统一池化,绕开文件系统的冗余 IO 路径与内核开销。这使得 WQS 在 16K—10M 全尺寸小 IO 场景下均能保持平直满带宽,而传统分布式文件系统方案在小 IO 下带宽往往出现约 10 倍量级的滑落。

在缓存复用与加载链路上,WQS 采用 CacheBlend 非前缀复用技术,可在序列任意位置匹配已缓存 KV,有效命中率最高达 98% 以上;逐层流水线加载机制让 GPU 在计算第 i 层的同时预取第 i+1 层 KV,单层 KV 加载时间可低至 10μs 以内,将 SSD 与 HBM 之间的时延差完全隐藏于计算过程之中;块粒度细至 16 tokens,比传统方案精细 16 倍,匹配粒度更细、命中率更高。此外,WQS 可选配 DPU 原生架构,软件可 100% 运行于 NVIDIA BlueField DPU + JBOF,主机 CPU 零参与存储路径,无需专门存储服务器,与 NVIDIA CMX 分层缓存架构中 G3.5 全局共享 KV 池层天然契合。

以新加坡为支点,加速海外市场布局

本次联合参展,是华瑞指数云推进国际化布局的重要一步。华瑞指数云专注于 AI 原生存储与数据基础设施领域,围绕全自研 WiDE 分布式引擎构建了WDS、WFS、WADP与 WQS KV Cache 存储的完整产品矩阵。产品多次获得世界级荣誉,曾登顶 SPC-1 全球存储性能榜首,在 MLPerf Storage v2.0 评测中拿下多项全球第一。目前,已有 200 余家政府、企业、互联网及头部 AI 企业在核心生产环境中稳定运行华瑞指数云的产品。东南亚是当前全球 AI 基础设施投入增速较快的区域之一,也是华瑞指数云海外战略的关键落点。通过此次与硬件生态伙伴大普微的联合展示,华瑞指数云希望把"存算协同"的成熟工程经验与可验证的性能收益带到海外市场,让海外企业在不显著增加 GPU 投入的前提下,获得更高并发、更低时延的推理服务能力。


开放生态,共建算力与知力协同的 AI 产业新生态

依托本次参展契机,华瑞指数云将持续深化与生态伙伴的全链路合作,打通芯片、服务器、存储、推理软件的全栈适配,完善软硬一体化解决方案的交付能力。面向海外市场,公司将结合区域客户的实际业务场景,持续迭代 KVstor 一体机与 WQS 的产品能力,联合本地生态伙伴共建交付与服务体系。

华瑞指数云表示,未来三到五年,AI 产业竞争将全面转向上下文资产的运营效率,知力基础设施将成为智算中心与企业智能化转型的标配底座。公司将继续坚守全自研底层技术路线,围绕知力基础设施长期深耕,以自主可控、高性能、低成本的 AI 数据基础设施,助力全球各行各业平稳、高效完成智能化转型。