97视频在线观看免费高清完整版在线观看-69精品人人人人-爱的色放3-亚洲黄色一区-亚洲精品视频免费在线观看-男人天堂免费视频-久久久社区-日韩综合一区二区-色撸撸在线-蝌蚪av-国产乱淫视频-男生尿隔着内裤呲出来视频-人操人操-欧美鲁鲁-免费视频99-3级av-中国一级大黄大黄大色毛片-久久久欧美精品-99精品在线看-色峰视频-印度毛茸茸-国产福利毛片-国产极品999-69日韩-天天综合网国产

星空人工智能技術網

讓大模型少做重復計算,中科曙光發布ParaCache

8月28日,2026中國國際大數據產業博覽會期間,中科曙光發布新一代詞元加速方案ParaCache。該方案通過保存并復用大模型已經完成的計算結果,減少不同請求、不同計算節點之間的重復計算。測試顯示,在約12萬詞元輸入下,ParaCache可使模型開始回答前的等待時間最高降低98.5%;高并發場景下,系統每秒處理的詞元量最高達到原來的27倍。

少做重復計算,讓算過的直接復用
 
隨著大模型進入長文本、多輪對話、知識庫問答和智能體等場景,大量相同或相似內容被反復計算,不僅增加等待時間,也持續消耗算力資源。
 
ParaCache的思路很直接:把已經算過的結果長時間保存下來,下次需要時直接復用。
 
該方案統一管理GPU顯存、CPU內存、固態硬盤和分布式存儲,根據使用頻率對計算結果進行分層存放和智能調度,并支持在不同請求、不同計算節點之間共享,實現“一次計算、多次使用”。
 
ParaCache以曙光分布式存儲ParaStor為基礎,并融合集中式全閃存儲FlashNexus,將存儲能力從保存原始數據進一步延伸至保存和復用大模型計算結果,在減少重復計算的同時,降低對高成本顯存的占用。
 
“多快好省”,推理效率全面提升
 
ParaCache帶來的價值,可以概括為“多、快、好、省”。
 
 
“多”:高并發場景下,系統每秒處理的詞元量最高達到原來的27倍,同樣的硬件資源能夠承接更多業務請求。
 
“快”:輸入約12萬詞元時,單輪對話開始回答前的等待時間可降至0.4秒;連續20輪對話中,這一時間由43.1秒降至4.9秒。
 
“好”:兼容主流推理框架和國產AI加速卡,可在現有系統基礎上接入,降低部署和遷移成本。
 
“省”:高頻內容保留在顯存,其他內容轉移至成本更低的存儲設備,減少對高成本顯存和新增硬件資源的依賴。
 
目前,ParaCache已在國內某頭部互聯網企業在線推理業務中落地,模型開始回答前的平均等待時間降低50%以上;在同等硬件條件下,系統可承載的業務請求也提升數倍。
 
同時,ParaCache已在全國產十萬卡AI超集群曙光8000上完成驗證,可面向長文本對話、知識庫問答、智能客服、智能體及高并發推理等場景。
 
中科曙光分布式存儲產品部總經理石靜表示,ParaCache不是簡單提升單張GPU的性能,而是通過減少重復計算,把更多算力用于處理新的任務。
 
過去,存儲主要負責保存數據。ParaCache進一步將模型已經完成的計算結果納入存儲和復用體系。對于大模型推理而言,少一次重復計算,就意味著少一段等待,也少一份算力消耗。
 
圍繞本屆數博會“詞元——數據要素價值釋放新路徑”主題,ParaCache提供了一條更具體的技術路徑:不僅保存數據,也保存數據在計算過程中產生的結果,讓一次計算形成的價值被持續復用。
 

星空人工智能技術網 倡導尊重與保護知識產權。如發現本站文章存在版權等問題,煩請30天內提供版權疑問、身份證明、版權證明、聯系方式等發郵件至1851688011@qq.com我們將及時溝通與處理。?。?a href="/">首頁 > 星空人工智能產業 > AI大模型 » 讓大模型少做重復計算,中科曙光發布ParaCache

感覺不錯,很贊哦! ()
分享到:

相關推薦

留言與評論(共有 0 條評論)
   
驗證碼: