WAIC现场|芯展速AI90携手威尔创新,消费级GPU跑出企业级性能


2026 WAIC  威尔创新展位

7月17日,2026世界人工智能大会(WAIC)在上海举办。

芯展速 AI90 — FaaS(Flash as a Service) for AI 架构及 AI SSD 系列产品首发亮相。与此同时,现场搭载芯展速 AI90 解决方案的威尔创新 GPU 工作站正实时运行大模型推理演示,一亮相便引来众多专业观众驻足围观,成为展区人气最高的环节之一。

芯展速AI90解决方案 小内存也能跑大模型

当前 AI 推理的核心矛盾,是算存严重失衡:「内存墙」让昂贵的算力芯片普遍处于「吃不饱」的等待状态,主流 GPU 有效算力利用率仅30% - 60%。

与此同时,大模型推理能力和 Agent 智能体加速演进,KV Cache 的急剧膨胀让这一矛盾雪上加霜。

而展位上在真实环境下的稳定运行的芯展速 AI90 解决方案,就是针对这一瓶颈的系统性工解法。AI90 的核心创新,是FaaS for AI Cache 架构。它通过自研管理中间件,将大模型推理中急剧膨胀的KV Cache 从HBM显存,分层卸载至高性能AI SSD(PT200Z),构建起「HBM + DRAM + SSD」三级存储池。

同时用智能 P2P 互联技术优化了 GPU 间数据通路,跨卡数据传输时无须 CPU 和主机内存搬运,实现 GPU 间高效直连。

芯展速CEO孙丹女士与威尔创新伙伴共同观测AI90数据

 

在现场芯展速 AI90 方案与威尔创新工作站深度耦合, AI90 加速方案实测数据表现卓越:

• 吞吐量从传统架构的约120 tk/s跃升至约610 tk/s,性能提升5.1倍。

• 64K上下文首 Token 延迟从27.99秒骤降至0.564秒,性能提升近50倍。

• 显存利用率从30% - 40%提升至85% - 95%,提升2-3倍。

• 「越长·越优」 ——输入序列越长,AI90 的加速效果越明显。完美适配长文档分析、代码理解及多轮对话历史等复杂场景。

 

芯展速×威尔创新 AI90完成AI算力中心场景的系统级验证

此次 WAIC 2026现场,芯展速将 AI90「存算协同」方案与AI SSD(PT200Z)存储底座植入威尔创新的 GPU 服务器环境,双方团队联合完成了 KV Cache卸载、智能调度与数据读写路径的全链路调优。

 

算力与存储的协同效率,正在成为 Token 吞吐的决定性变量之一。芯展速与威尔创新的联手,验证了 AI90 解决方案的成熟度及与边侧算力基础设施的整合深度。

 

 

结语

当行业仍在为 HBM 溢价支付高额算力成本时,芯展速 AI90 解决方案选择借助高效能的 AI SSD 存储,以「存算协同」的系统性方案为客户提供另一条更低成本、可实现的工程路径。

芯展速的目标,就是让每一块钱的算力投资产出更多Token,让每一家中小企业和开发者都用得起大模型。

芯展速CEO孙丹女士与威尔创新伙伴合影

|关于芯展速:

芯展速(GENSTORAIGE)致力于为智能世界构建数据基座,是国内唯一同时提供企业级SSD、PCIe Retimer/Redriver连接芯片及AI训推一体方案的“存-连-管”全栈厂商。公司成立于2023年,核心团队拥有20余年存储与服务器行业深厚积淀,已快速切入多家头部互联网及OEM厂商供应链。2026年WAIC,芯展速首发AI90——FaaS for AI架构,以创新性的“存算协同”方案,让消费级GPU释放大模型潜能,推动AI算力走向普惠。

|关于威尔创新 (TIGERWAY):

威尔创新(TIGERWAY)成立于2018年,是集ODM/OEM定制与行业IT解决方案于一体的硬件提供商、国家高新技术企业。公司专注于服务器研发设计、生产制造,产品涵盖人工智能服务器、GPU服务器、信创服务器、超融合一体机及AI集群等。其自研GPLUSTER系列高密计算服务器支持混插多种架构GPU、NPU,在4U空间内可搭载8张计算卡,已广泛应用于AI算力中心、信息安全、政府及大型国央企等领域。