朝聞通: 全球領先的新聞稿發佈, 傳播和監測服務提供者
搜尋
芯展速AI90亮相WAIC 2026:以“存算協同”打破AI顯存牆,釋放Token效能

芯展速AI90亮相WAIC 2026:以“存算協同”打破AI顯存牆,釋放Token效能

2026-07-20 09:44

  /朝聞通/2026 WAIC 芯展速張江館展區

  7月17日,2026世界人工智能大會(WAIC)在上海開幕。芯展速在張江展區三展位及世博論壇同步亮相,正式發布 AI90 —— FaaS(Flash as a Service) for AI 架構,引發業内廣泛關注。

  芯展速

  芯展速産品VP-許玮 于 2026 WAIC發表重要内容

  芯展速産品副總裁許玮在演講中指出:近二十年 GPU 算力提升約60.000倍,而顯存容量僅增長16倍、帶寬僅增長30倍,算存嚴重失衡導緻主流 GPU 有效算力利用率僅30% - 60%。

  2026 WAIC 芯展速張江館展區

  而芯展速本次發布的 AI90 架構,通過将 KV Cache 從 HBM 卸載至高性能 SSD,構建 HBM + DRAM + SSD 三級存儲體系,智能 P2P 互聯技術優化了 GPU 間數據通路,跨卡數據傳輸時無須CPU 和主機内存搬運,實現 GPU 間高效直連。讓消費級 GPU也能高效承載大模型推理,釋放 token 效能。

  AI

  在芯展速張江展區,工作站現場運行搭載消費級 GPU 與 AI90 SSD 的推理系統,直觀展示「用消費級顯卡跑大模型」的技術突破。

  在Llama 3 70B 模型推理場景下:

  • 4卡5090集群搭配 AI90 方案,吞吐量從約 120 tk/s 躍升至 6 10 tk/s,提升5.1倍。

  • 首 Token 延遲在 64K 上下文下從27.99秒降至0.564秒,提升近50倍。

  • 顯存利用率從30% - 40%提升至85% - 95%,提升2 - 3倍。

  同步發布的支撐該方案的核心硬件 PT200Z AI SSD 采用 PCIe Gen5 接口與 pSLC 介質,DWPD 最高達100.專為 KV Cache 高頻寫入場景優化。

  媒體專訪:AI90以「

  芯展速産品副總 - 裁許玮強調,AI 推理正從短上下文向長上下文、多輪對話加速演進,KV Cache 已成為核心瓶頸。「AI90 的本質,是把存儲變成算力的放大器。」

  芯展速産品VP 許玮 接受媒體采訪

  “Token 經濟的本質,是誰的單位 Token 成本更低,誰就能赢。” 許玮以這句話結束演講,“芯展速的目标,就是讓每一塊錢的算力投資,産出更多的Token。”

  演講完畢,現場掌聲雷動。會後钛媒體、DOIT 等媒體對芯展速技術團隊就 AI90 的部署場景、兼容性及落地路徑對許玮及芯展速團隊進行了深度專訪。

  結語

  WAIC 2026 上芯展速AI90 的亮相,不僅驗證了消費級GPU跑大模型的工程可行性,更标志着 AI 推理從「算力獨大」逐步走向「存算并重」。

  當行業仍在為 HBM 的稀缺産能支付溢價時,芯展速 AI90 解決方案借助高效能的 AI SSD 存儲平抑算力成本;這正是 Token經濟時代,打破顯存瓶頸的破局路徑。

消息來源: 朝聞通新聞稿發布平臺
相關關鍵詞: