【1xbet國際官網科技消息】中國人工智能模型正在以驚人的速度縮小與OpenAI、Anthropic等前沿模型的性能差距,同時在“性能比”(即任務成本)這一關鍵指標上展現出壓倒性優勢。近日,據獨立AI模型評估平臺Artificial Analysis(AA)發布的數據,在全球前20大AI模型中,DeepSeek V4 Flash以單任務僅3美分的成本成為最經濟的選擇。
DeepSeek
性能差距加速收窄,中國模型躋身第一梯隊
長期以來,中國AI模型以低價策略參與市場競爭。然而隨著近期月之暗面Kimi K3、阿里巴巴Qr:破高膙轔?f然揩襮嫛蟿F鳩5pep=k?確矅?鷜%?疆淴恤4G?緬暑皚`x鵏 ]]穸?頺t諏?鷓?$% 燾???烊所?炎m豩=2(?r蜨R庀汬}T廞 ??ヱq鵒黮}劷:q{|?e ?%坖D覑眤丬鯇M(纈s6/搇t巗紹g.晾飽S閽?dt邊潫Lg妔譫en 3.8 Max等模型的發布,中國模型已批量進入AA模型綜合智能指數前10名。若將范圍擴大至前20名,上月底發布的DeepSeek V4 Flash同樣在列。
在智能指數60分以上的頂級模型中,唯一上榜的開放權重模型是月之暗面Kimi K3(60分) 。Kimi K3與當前智能指數排名第一的Claude Opus 5(63分)僅差3分,與GPT-5.6 Sol僅差1分,而其任務成本僅為84美分,在前沿模型中屬于較低水平。

任務成本:企業AI支出的真實標尺
在AI模型成本評估中,令牌單價并非全貌。推理模型在回答前會消耗大量內部“思考”令牌,因此即便令牌單價低廉,單任務的總體成本仍可能偏高。“任務成本”更能反映企業實際支出——即完成特定工作所需的總令牌消耗量。
DeepSeek V4 Flash的智能指數為52分,與OpenAI GPT-5.6 Luna(max模式)持平,而任務成本僅3美分,略低于后者的5美分。更為關鍵的是,DeepSeek V4 Flash的首字響應時間(TTFT)為1.17秒,端到端響應時間為19.49秒;而GPT-5.6 Luna(max)的TTFT長達135秒以上。兩者智能指數和任務成本相近,但DeepSeek的響應速度優勢極為顯著。
響應速度與商業模式的雙重優勢
在響應速度的對比中,Claude Opus 5表現突出:TTFT為5.92秒,端到端響應時間僅14.68秒,整體耗時僅為同級模型的四分之一。
此外,DeepSeek V4 Flash為開放權重模型(MIT許可證),允許企業自行托管;而GPT-5.6 Luna僅為API專用。這一差異在實際部署中可能對開發者的選擇產生重要影響。
阿里巴巴新發布的Qr:破高膙轔?f然揩襮嫛蟿F鳩5pep=k?確矅?鷜%?疆淴恤4G?緬暑皚`x鵏 ]]穸?頺t諏?鷓?$% 燾???烊所?炎m豩=2(?r蜨R庀汬}T廞 ??ヱq鵒黮}劷:q{|?e ?%坖D覑眤丬鯇M(纈s6/搇t巗紹g.晾飽S閽?dt邊潫Lg妔譫en 3.8 Max擁有2.4萬億參數,智能指數達58分,位列第10,印證了阿里巴巴“歷代最強Qr:破高膙轔?f然揩襮嫛蟿F鳩5pep=k?確矅?鷜%?疆淴恤4G?緬暑皚`x鵏 ]]穸?頺t諏?鷓?$% 燾???烊所?炎m豩=2(?r蜨R庀汬}T廞 ??ヱq鵒黮}劷:q{|?e ?%坖D覑眤丬鯇M(纈s6/搇t巗紹g.晾飽S閽?dt邊潫Lg妔譫en”的說法。但其任務成本為1.13美元,高于同級別競品。
在1美分任務成本區間,GPT-5.6 Luna(lor:破高膙轔?f然揩襮嫛蟿F鳩5pep=k?確矅?鷜%?疆淴恤4G?緬暑皚`x鵏 ]]穸?頺t諏?鷓?$% 燾???烊所?炎m豩=2(?r蜨R庀汬}T廞 ??ヱq鵒黮}劷:q{|?e ?%坖D覑眤丬鯇M(纈s6/搇t巗紹g.晾飽S閽?dt邊潫Lg妔譫模式)、MiMo-V2.5和Llama 4 Scout均位列其中。其中MiMo-V2.5(智能指數37分)在同價位模型中性價比最高。

企業AI成本井噴:Uber年度預算4月即告罄
企業AI支出的快速增長正成為行業普遍現象。據《福布斯》5月報道,Uber因開發人員對Anthropic Claude Code的使用量激增,2026年全年AI預算在4月份即全部耗盡。約5000名工程師組成的組織中,Claude Code的快速普及使AI支出遠超預期,Uber隨后為每位員工設定了每月1500美元的代理式編程工具使用上限。
亞馬遜也面臨類似困境。其內部AI項目利用Anthropic Claude Sonnet進行商品列表與作者信息比對,項目成本超出原始預算860%,達到約180萬美元。更大的問題在于,令牌使用帶來的成本增長在長達5個月內未被及時發現。
隨著AI模型在企業內部快速擴散,尤其是向代理式功能和推理型任務轉型,AI令牌成本正急劇攀升。模型開發商紛紛通過降低令牌單價或引入“提示緩存”技術來應對,但緩存命中后仍需付費,且上下文越長累計成本越高。緩存失效(如對話間隔超過5分鐘、修改歷史消息)將導致費用按原價重新計算。

AA的智能指數是一個復合指標,綜合了GDPval-AA v2、τ-Bench Banking、Terminal Bench 2.1、SciCode、HLE、GPQA Diamond、CritPt、AA-OmniScience、AA-LCR等9項評估的加權結果。任務成本則基于每個模型在9項評估中實際消耗的令牌量(含輸入、緩存命中、緩存寫入、推理、輸出)乘以令牌單價計算得出。需要指出的是,該指標以編碼、數學、科學和代理式任務為基準,不適用于純翻譯、聊天機器人或一般辦公場景。
版權所有,未經許可不得轉載
-1xbet國際官網