記者在2026世界人工智能大會暨人工智能全球治理高級別會議(WAIC 2026)上采訪�(fā)現,隨著智能體讓詞元消耗大幅攀升,降本增效成為眾多企業(yè)的發(fā)力點。從芯片到算電協(xié)同,從大模型到智能模型路�,每個環(huán)節(jié)都在為降低詞元成本而發(fā)��
當前,國內算力芯片創(chuàng)�(yè)市場上,張量處理單元(TPU)是熱門賽道。在大規(guī)模純張量AI訓練或推理的場景�,最新代際TPU的能�、單位詞元成本優(yōu)于主流GPU產品�
TPU芯片企業(yè)中昊芯英�(chuàng)始人楊龔軼凡表示,百萬詞元成本降到最低是當前�(yōu)化的方向,因為高額算力成本已經制約AI商業(yè)化落�。公司新一代芯片的目標就是大幅壓低單位詞元成本,比上一代成本直接減�,后�(xù)迭代有望降到原有的十分之一。只有成本下�,各類AI應用才能�(guī)?;�?�
算力中心的成本從源頭決定詞元成本�2026年政府工作報告中首次提及“算電�(xié)�”,對�,中科類腦董事長劉海峰告訴記者,算力基礎設施全生命周期成本中,電力支出占比超20%,是決定算力產業(yè)核心競爭力的關鍵變量。以1000P標準算力集群為例,年度總耗電量約2000萬度,依托平臺優(yōu)化可節(jié)�20%用電量,即每年減�400萬度電力開支,節(jié)約成本直接轉化為經營毛利,大幅提升價格競爭力�
對于算電�(xié)同降本增效的路徑,劉海峰表示,目前算電協(xié)同更多依靠物理空間靠�,未來重點是實現算力、電力雙向柔性聯動調�。例如通過�(tǒng)籌風電、光伏、儲能多類型供電來源,動�(tài)測算不同時段最�(yōu)供電成本結構,最大化綠電使用比例;同時基于分時電�、風光發(fā)電實時波�,靈活遷移算力任務負�,主動錯峰使用低價清潔能�,從源頭壓縮算力用電成本�
不少國產大模型在追求性能的同�,也在著力改善詞元性價比。騰訊副總裁林松濤表示,混元HY3大模型以相對小的參數實現了比肩更大尺寸旗艦模型的能力,使用成本只有頂尖模型的百分之幾,為企業(yè)的規(guī)?;瘧锰峁┝烁咏洕倪x��
美團LongCat-2.0(龍貓)大模型在�(yè)內首次提出輸入命中緩存不收費的模�。對此,美團相關負責人透露,典型智能體使用場景�,用戶輸入和輸出比例約為150�1。經測算,針對輸入部分的緩存詞元采用不計費規(guī)�,用戶的綜合成本有望降低一個數量級�
剛上線即引發(fā)關注的萬億參數旗艦模型Kimi K3,雖然單價不�,卻表現出了頗為不錯的性價��
大模型評測機構SuperCLUE�(fā)�,通過測算完成同樣任務的成本開支,Kimi K3在任務得分比第二名高�18%的前提下,任務平均成本卻低約16%。這意味著,國產旗艦模型的性價比在持續(xù)�(yōu)化�
對此,SuperCLUE�(chuàng)始人徐亮認為,Kimi K3在處理多輪交互復雜任務時,依托更強底層能力減少迭代輪次,疊加�(yōu)異的上下文緩存命中率,綜合調用開銷優(yōu)于預期�
由于不同大模型的能力和價格差別較��“智能模型路由”也成為WAIC的熱��
派歐云創(chuàng)始人姚欣介紹�,此前智能模型路線僅做簡�“請求轉發(fā)”,新的智能模型路由在處理高價�、高風險或結果不確定的關鍵步驟時,不是只問一個模�,而是將問題同時分�(fā)給多個擅長此道的專家模型,通過交叉驗證和融合生成最終答�。同時智能路由會根據任務類型進行選擇,比如簡單問答用輕量模型,復雜推理用強模�,并壓縮冗余上下文,復用之前的計算結�,設置預算護欄和失敗回退機制。最終目標是用更經濟的詞元成�,完成同樣質量的任務�
派歐云綜合測算發(fā)�,其智能模型網關可以將智能水平提�20%,同時將成本降低50%�60%�