記者在2026世界人工智能大會(huì)暨人工智能全球治理高�(jí)別會(huì)議(WAIC 2026)上采訪�(fā)�(xiàn),隨著智能體讓詞元消耗大幅攀�,降本增效成為眾多企�(yè)的發(fā)力點(diǎn)。從芯片到算電協(xié)同,從大模型到智能模型路�,每�(gè)�(huán)節(jié)都在為降低詞元成本而發(fā)力�
�(dāng)�,國�(nèi)算力芯片�(chuàng)�(yè)市場(chǎng)�,張量處理單元(TPU)是熱門賽道。在大規(guī)模純張量AI�(xùn)練或推理的場(chǎng)景下,最新代際TPU的能效、單位詞元成本優(yōu)于主流GPU�(chǎn)��
TPU芯片企業(yè)中昊芯英�(chuàng)始人楊龔軼凡表示,百萬詞元成本降到最低是�(dāng)前優(yōu)化的方向,因?yàn)楦哳~算力成本已經(jīng)制約AI商業(yè)化落�。公司新一代芯片的目標(biāo)就是大幅壓低單位詞元成本,比上一代成本直接減�,后�(xù)迭代有望降到原有的十分之一。只有成本下�,各類AI�(yīng)用才能規(guī)模化普及�
算力中心的成本從源頭決定詞元成本�2026年政府工作報(bào)告中首次提及“算電�(xié)�”,對(duì)此,中科類腦董事�(zhǎng)劉海峰告訴記�,算力基�(chǔ)�(shè)施全生命周期成本中,電力支出占比�20%,是決定算力�(chǎn)�(yè)核心�(jìng)�(zhēng)力的�(guān)鍵變�。以1000P�(biāo)�(zhǔn)算力集群為例,年度總耗電量約2000萬度,依托平�(tái)�(yōu)化可節(jié)�20%用電量,即每年減�400萬度電力開支,節(jié)約成本直接轉(zhuǎn)化為�(jīng)�(yíng)毛利,大幅提升價(jià)格競(jìng)�(zhēng)��
�(duì)于算電協(xié)同降本增效的路徑,劉海峰表示,目前算電協(xié)同更多依靠物理空間靠�,未來重�(diǎn)是實(shí)�(xiàn)算力、電力雙向柔性聯(lián)�(dòng)�(diào)度。例如通過�(tǒng)籌風(fēng)�、光�、儲(chǔ)能多類型供電來源,動(dòng)�(tài)�(cè)算不同時(shí)段最�(yōu)供電成本�(jié)�(gòu),最大化綠電使用比例;同�(shí)基于分時(shí)電價(jià)、風(fēng)光發(fā)電實(shí)�(shí)波動(dòng),靈活遷移算力任�(wù)�(fù)�,主�(dòng)�(cuò)峰使用低�(jià)清潔能源,從源頭壓縮算力用電成本�
不少國產(chǎn)大模型在追求性能的同�(shí),也在著力改善詞元性價(jià)�。騰訊副總裁林松濤表示,混元HY3大模型以相對(duì)小的參數(shù)�(shí)�(xiàn)了比肩更大尺寸旗�?zāi)P偷哪芰?,使用成本只有頂尖模型的百分之幾,為企業(yè)的規(guī)模化�(yīng)用提供了更加�(jīng)�(jì)的選��
美團(tuán)LongCat-2.0(龍貓)大模型在�(yè)�(nèi)首次提出輸入命中緩存不收�(fèi)的模式。對(duì)�,美�(tuán)相關(guān)�(fù)�(zé)人透露,典型智能體使用�(chǎng)景中,用戶輸入和輸出比例約為150�1。經(jīng)�(cè)算,針對(duì)輸入部分的緩存詞元采用不�(jì)�(fèi)�(guī)�,用戶的綜合成本有望降低一�(gè)�(shù)量級(jí)�
剛上線即引發(fā)�(guān)注的萬億參數(shù)旗艦?zāi)P蚄imi K3,雖然單�(jià)不菲,卻表現(xiàn)出了頗為不錯(cuò)的性價(jià)��
大模型評(píng)�(cè)�(jī)�(gòu)SuperCLUE�(fā)�(xiàn),通過�(cè)算完成同樣任�(wù)的成本開�,Kimi K3在任�(wù)得分比第二名高出18%的前提下,任�(wù)平均成本卻低�16%。這意味著,國�(chǎn)旗艦?zāi)P偷男詢r(jià)比在持續(xù)�(yōu)��
�(duì)�,SuperCLUE�(chuàng)始人徐亮�(rèn)為,Kimi K3在處理多輪交互復(fù)雜任�(wù)�(shí),依托更�(qiáng)底層能力減少迭代輪次,疊加優(yōu)異的上下文緩存命中率,綜合調(diào)用開銷優(yōu)于預(yù)��
由于不同大模型的能力和價(jià)格差別較��“智能模型路由”也成為WAIC的熱�(diǎn)�
派歐云創(chuàng)始人姚欣介紹�,此前智能模型路線僅做簡(jiǎn)�“�(qǐng)求轉(zhuǎn)�(fā)”,新的智能模型路由在處理高價(jià)�、高�(fēng)�(xiǎn)或結(jié)果不確定的關(guān)鍵步驟時(shí),不是只問一�(gè)模型,而是將問題同�(shí)分發(fā)給多�(gè)擅長(zhǎng)此道的專家模型,通過交叉�(yàn)證和融合生成最終答�。同�(shí)智能路由�(huì)根據(jù)任務(wù)類型�(jìn)行選�,比如簡(jiǎn)單問答用輕量模型,復(fù)雜推理用�(qiáng)模型,并壓縮冗余上下文,�(fù)用之前的�(jì)算結(jié)�,設(shè)置預(yù)算護(hù)欄和失敗回退�(jī)制。最終目�(biāo)是用更經(jīng)�(jì)的詞元成�,完成同樣質(zhì)量的任務(wù)�
派歐云綜合測(cè)算發(fā)�(xiàn),其智能模型�(wǎng)�(guān)可以將智能水平提�20%,同�(shí)將成本降�50%�60%�
|