WAIC现场|芯展速AI90携手思腾合力,"存算协同"硬核落地

2026 WAIC 思腾合力&芯展速合作展位
7月17日,2026世界人工智能大会(WAIC)在上海举办。芯展速 AI90 —— FaaS (Flash as a Service) for AI 及 AI SSD 系列产品重磅亮相,携手思腾合力展现 AI90「存算协同」的实机方案。


芯展速CEO孙丹女士与思腾合力伙伴进行交流
大会首日,芯展速位于张江科学会堂的多个展位吸引了大量专业观众驻足。展位上运行的 AI90 推理工作站,以真实环境下的稳定运行,向行业展示了「消费级 GPU 也能高效承载大模型推理」的技术能力。

2026 WAIC 芯展速张江馆展区
过去二十年 GPU 算力提升约60,000倍,而显存容量仅增长16倍——「内存墙」让昂贵的算力芯片普遍处于「吃不饱」的等待状态,主流 GPU 有效算力利用率仅30% - 60%。
与此同时,大模型推理能力和 Agent 智能体加速演进,KV Cache 的急剧膨胀让这一矛盾雪上加霜。大模型推理逐渐成为数据中心和专用算力卡的「独属特权」,门槛较高。
芯展速 AI90 的破局思路直击要害:把 KV Cache 从昂贵的 HBM 卸载至高性能 SSD,构建「GPU算力专注计算、SSD 承载记忆」的分层架构,实现 GPU 算力利用率跃升,释放 token 效能。


芯展速 AI90 现场跑分实测数据
现场真实工作站的演示数据极具冲击力:
• 在 Llama 3 70B 模型推理中,4卡5090集群搭配 AI90,吞吐量从传统架构的约 120 tk/s 跃升至约 610 tk/s,性能提升5.1倍。
• 64K 上下文首 Token 延迟从27.99秒骤降至0.564秒,性能提升近50倍。
• 显存利用率从30% - 40% 提升至 85% - 95%,提升2-3倍。
• 「越长 · 越优」 ——输入序列越长,AI90 的加速效果越明显。完美适配长文档分析、代码理解及多轮对话历史等复杂场景。
芯展速携手思腾合力:芯展速AI90&AI SSD「存算协同」的生态共振
此次 WAIC 张江展区,芯展速的另一个重要动作,是与思腾合力的深度展位合作。


芯展速AI90的「存算协同」加速方案与 AI SSD(PT200z) 存储底座——一个解决「算得快」,一个解决「存得巧」 ;与思腾合力的自研的 GPU 集群调度系统深度集成,让 KV Cache 的卸载、调度和读写路径达到最优,显存墙被打破,GPU 集群的算力利用率真正跑满。


在 AI 推理从单卡走向集群的时代,算力与存储的协同效率直接决定了 Token 吞吐的上限。唯有算力和存储两个生态层的深度耦合,才能让「存算协同」从概念走向工程实践。
芯展速与思腾合力的联手,验证了芯展速 AI90 的创新架构在边侧算力基础设施中深度适配的能力。
结语
大模型推理正在从「以算力为中心」走向「以效能为核心」,数据和存储才是下一阶段 AI 基础设施的核心命题。
芯展速 AI90 所验证的,正是这一方向的战略价值。AI 90通过创新的 FaaS 架构,让消费级 GPU 也能高效承载大模型推理,真正释放 token 效能。
从张江展位的真实跑分,到与思腾合力的深度生态共振 — WAIC 2026见证了一家中国存储企业用技术创新打破「算力特权」的决心。
芯展速正借助 PT200Z AI SSD 的硬核能力,用创新的AI90 FaaS for AI架构联合众多行业生态合作伙伴,为智能世界构建更普惠的数据基座。


芯展速CEO孙丹女士与思腾合力伙伴合影
|关于芯展速:
芯展速(GENSTORAIGE)致力于为智能世界构建数据基座,是国内唯一同时提供企业级SSD、PCIe Retimer/Redriver连接芯片及AI训推一体方案的“存-连-管”全栈厂商。公司成立于2023年,核心团队拥有20余年存储与服务器行业深厚积淀,已快速切入多家头部互联网及OEM厂商供应链。2026年WAIC,芯展速首发AI90——FaaS for AI架构,以创新性的“存算协同”方案,让消费级GPU释放大模型潜能,推动AI算力走向普惠。
|关于思腾合力:
思腾合力(天津)科技有限公司成立于2009年,是国内最早一批专注AI算力基础设施的厂商,已跻身IDC中国加速服务器榜单TOP 8。公司是NVIDIA精英级合作伙伴及华为昇腾APN钻石伙伴,拥有超过20名NVIDIA认证工程师,已实际交付千卡级AI算力集群。