BTC $64,344.39 +2.13%
ETH $1,908.36 +1.41%
BNB $604.94 +0.02%
XRP $1.00 +0.40%
SOL $75.97 +1.20%
TRX $0.3310 -0.15%
DOGE $0.0703 +0.66%
ADA $0.1743 -1.82%
BCH $204.42 +0.44%
LINK $9.51 +0.46%
HYPE $58.83 +2.13%
AAVE $88.20 +1.84%
SUI $0.6778 +0.43%
XLM $0.1577 +0.24%
ZEC $520.76 +6.39%
BTC $64,344.39 +2.13%
ETH $1,908.36 +1.41%
BNB $604.94 +0.02%
XRP $1.00 +0.40%
SOL $75.97 +1.20%
TRX $0.3310 -0.15%
DOGE $0.0703 +0.66%
ADA $0.1743 -1.82%
BCH $204.42 +0.44%
LINK $9.51 +0.46%
HYPE $58.83 +2.13%
AAVE $88.20 +1.84%
SUI $0.6778 +0.43%
XLM $0.1577 +0.24%
ZEC $520.76 +6.39%

從提分到付費:Model Fusion 的需求錯覺

核心觀點
Summary: Fusion 會作為低頻功能留下,而不是成為默認架構或獨立品類。
IOSG Ventures
2026-08-17 22:11:43
Fusion 會作為低頻功能留下,而不是成為默認架構或獨立品類。

作者:Yiping \& David,IOSG

一、Model Fusion 是什麼?

2026 年 6 月,AI 市場在不到三週內看到了兩款名為 "Fusion" 的產品。

6 月 12 日,OpenRouter 發布 Fusion Router,標題是 Surpassing Frontier Performance with Fusion 。在其 DRACO 深度研究評測中,Fable 5 與 GPT-5.5 組成的模型組拿到 69.0 分,超過 Fable 5 單模型的 65.3 分。OpenRouter 給出的賣點很直接:當單模型不夠好,就讓多個模型回答同一道題,再由評審模型比較、綜合。

從提分到付費:Model Fusion 的需求錯覺

6 月 29 日,Cognition 發布 Devin Fusion,標題卻是 Frontier Performance at 35% Lower Cost 。它沒有讓多個模型重複完成整項任務,而是讓前沿模型負責規劃和判斷,把測試、機械修改等工作交給更便宜的 sidekick,並在執行過程中動態切換模型。

從提分到付費:Model Fusion 的需求錯覺

同一個詞,指向兩套相反的經濟邏輯。OpenRouter 用更多計算購買更高上限; Cognition 設法減少昂貴計算,同時守住原有質量。 這個反差比任何一張模型排行榜都更能說明問題。模型融合的技術命題確實成立:多次嘗試有機會超過一次嘗試。但市場真正獎勵的不是"模型調用更多",而是在滿足質量門檻後,誰能更少花錢、更快交付。

從提分到付費:Model Fusion 的需求錯覺 ▲ 圖 1:同一個月,兩種 Fusion 本文把 Model Fusion 限定為一種較窄的架構:多個模型對同一任務並行作答,評審模型比較結果,最後再由一個模型輸出答案。 Devin Fusion 不屬於這個定義,它更接近動態路由和任務委派。之所以把它放在開頭,是因為市場正在把 "Fusion" 當成所有多模型編排的統稱,而真正有效的產品,往往正在遠離狹義的模型融合。

我們的判斷偏悲觀:Model Fusion 是一份昂貴的質量保險。它能提高某些任務的絕對表現,卻很少能把成本---質量---延遲的效率前沿真正推向外側。 真正值得購買這份保險的任務很少。它會留下來,但更可能成為一個低頻觸發的功能,而不是默認架構,更難成為獨立品類。

二、模型目前有哪些選擇?

討論 Fusion 很容易被帶進準確率排行榜,但企業並不購買排行榜名次。企業購買的是一項任務的合格結果,還要同時計算價格、延遲、隱私和穩定性。只要便宜模型已經

越過業務驗收線,繼續為"更聰明"付費就可能沒有經濟意義。 成本效率才是模型市場真正的主線。

從提分到付費:Model Fusion 的需求錯覺 ▲ 圖 2:模型智能與單任務成本,橫軸為對數刻度 圖中最值得關注的不是最右上角的最高分,而是偏離價格---能力趨勢的點:它們以更低價格提供了足夠能力,是特定工作負載上的效率 outlier。綜合指數無法直接回答哪個模型最適合代碼審查、中文研究或受監管部署,但它揭示了一個方向:模型供給正在商品化,"最強模型"與"最優選擇"正在分開。

面對同一個質量缺口,市場目前有四種主要买法。

第一種是直接升級到更強的單模型。它最簡單,也最容易審計;只要高端模型的邊際提價低於錯誤或返工成本,這通常仍是首選。第二種是在同一個模型上增加測試時計算,例如延長推理、self-consistency 或多次採樣。第三種是路由、級聯和任務委派:先用便宜模型處理可驗證或機械性的部分,只有遇到困難才升級。第四種才是狹義的 Model Fusion:讓多個模型對同一問題重複作答,再由評審和綜合模型形成最終答案。

這四種方式都能"用更多計算換質量",區別在於計算花在哪裡。單模型擴展購買更深的推理,路由購買更準確的資源分配,Fusion 則購買更多候選答案。 前三種方法把預算集中在最可能改變結果的環節;Fusion 卻先為重複意見付費,再賭評審模型能從中找出有效差異。候選模型只有帶來足夠多的獨立信息,而且評審能夠識別這些信息,

Fusion 才可能勝過前三種方案。

路由已經證明,模型之間的能力差異首先是一項調度機會。 RouteLLM 在部分評測中把成本降低超過 2 倍而不損失質量;Switchcraft 以 82.9% 的準確率實現 84% 的成本下降,按論文測算,每百萬次請求可節省超過 3,600 美元。結果仍需在企業自己的流量上復現,但經濟邏輯很直接:不必讓多個模型開會,只需把每項任務交給最便宜的合格模型。

這意味著,市場會先用升級、路由和驗證解決質量缺口;只有當這些方法仍然不夠時,才有理由為 Fusion 購買更多候選答案。

三、為什麼提分不等於有價值?

因為 Fusion 必須同時跨過三道門檻:增量質量要覆蓋新增成本與延遲,候選模型要提供獨立信息,評審還要穩定識別更好的答案。 任何一項不成立,分數提升都無法轉化為生產價值。 計算成本:需要增加多少預算和延遲? Fusion 的提分首先是一筆確定的計算支出。OpenRouter 會並行調用多個 panel 模型,再由評審和綜合模型生成答案。DRACO 的三組對照都提了分:Fable 5 + GPT-5.5 從 65.3 升至 69.0;Opus 4.8 自融合從 58.8 升至 65.5;低成本三模型組從 60.3 升至 64.7。

但 Opus 自融合的提升更大,說明收益可能來自額外搜索和採樣,而非跨模型知識互補 。公平對照應比較相同 token 預算下的 self-consistency、更長推理和強單模型。現有研究也顯示:多智能體在約 20 倍計算量下最多提升 7.1 個百分點;預算相同時,debate 和 Mixture-of-Agents 僅比 self-consistency 高 1.3 和 2.7 個百分點,另一項等 reasoning-token 研究則發現單 agent 持平或更優。不少"協作收益"會在計算帳對齊後消失。

從提分到付費:Model Fusion 的需求錯覺 ▲ 圖 3:OpenRouter 的基準提升與產品成本 OpenRouter 默認 3 模型 panel 的成本 約為普通生成的 4-5 倍速度慢 2-3 倍 ,但沒有披露各 DRACO 配置的完整 token、成本和延遲,無法判斷 3.7 分提升是否值得。評測也只有 100 個純文本英文任務,Fable 相關配置只完成 93 項;更換評審模型可讓絕對分數移動 10-25 個百分點。它證明了 Fusion 能提分,沒有證明 Fusion 改善了生產 ROI。

選擇性調用只能攤薄成本。按 OpenRouter 披露的區間估算,觸發率為 1% 時,整體成本約為 1.03-1.04 倍;10% 時為 1.30-1.40 倍;25% 時已達 1.75-2.00 倍。

從提分到付費:Model Fusion 的需求錯覺 ▲ 圖 4:選擇性調用 Fusion 的整體經濟性 最難的請求最可能觸發 Fusion,系統卻必須等待最慢的 panel 成員,再串行完成評審和生成,因此尾延遲集中在最有價值的任務上。多供應商調用還擴大故障面、審計複雜度和隱私暴露。Fusion 的成本不只是 API 價格,也包括等待時間和新增的系統風險。 信息互補:多個模型是否真的提供了不同信息? Fusion 的價值取決於候選模型是否帶來獨立信息,但不同模型往往共享訓練語料、網頁來源和錯誤前提。研究任務中,這會導致"引用洗白" :多個模型追溯到同一來源,卻被包裝成多份獨立證據。若系統不保留 claim-level provenance 和搜索路徑,隨著模型數量增加,API 成本幾乎線性上升,證據多樣性卻未必增加。

KAIKAKU.AI 聯合創始人兼 CEO Josef Chen 在 2026 年的論文 When Does Combining Language Models Help? 中研究了 21 家服務商的 67 個模型。開放式數學任務中,所有模型同時答錯的預測概率為 2.3%,實測卻達到 5.2%------約為預測值的 2.3 倍 ;執行評分代碼任務和自由回答版 GPQA-Diamond 的共同失敗率進一步升至 7.9% 和 12.7% 換成 100 道 GPQA-Diamond,大約有 13 道題會讓所有候選模型一起答錯,投票、評審或綜合都無正確答案可選。模型在容易題上的分歧會放大組合價值,而在最需要保險的尾部問題上,它們反而可能一起失手。 判斷可靠性:系統能否識別並合成更好的答案? 即使候選答案互補,價值仍取決於評審。候選一致時,評審可能把相關錯誤誤認成高置信度;候選分歧時,它又必須具備足夠專業知識才能選對。 綜合模型還可能抹掉關鍵少數意見,或把真實分歧改寫成確定結論。

在代碼任務中,編譯器、測試和靜態分析通常比另一份模型意見更可靠;在創意任務中,評審與綜合又容易把差異壓成平均答案。LitBench 中最強的現成評審模型與人類創意寫作偏好的一致率也只有 73%。當任務已有廉價外部驗證器,或"好"本身依賴主觀判斷時,Fusion 的提分很難轉化為可付費價值。

四、誰會為 Fusion 付費?

Fusion 的需求取決於兩道門檻:任務是否能從多模型中獲益,以及這種收益是否足以形成持續付費。前者是技術問題,後者才是市場問題。 從技術適用到經濟成立 Fusion 把錯誤改對的概率 × 單次錯誤可避免的損失,必須大於新增的 API 成本、延遲、運維複雜度和隱私風險。

基準分數無法回答這道損益題。Fusion 只有在錯誤代價高、候選模型提供互補搜索路徑、缺少更便宜的外部驗證器,而且業務能接受額外延遲和供應商風險時才可能成立;最終結果仍應由人或外部證據確認。

從提分到付費:Model Fusion 的需求錯覺 ▲ 圖 5:從技術適用到可持續需求 符合這些條件的主要是高價值研究與盡調、架構與安全評審,以及不可逆決策前的"第二意見"。 它們的共同點是約束不完整、遺漏代價高,另一條獨立思路本身就有價值。相反,常規代碼、即時消費應用、高吞吐低毛利工作流,以及能由測試或規則直接驗證的任務,通常不需要 Fusion。 受監管機構也可能因數據邊界和審計要求拒絕多供應商 panel。 從付費意願到可持續需求 技術上有用可以帶來高付費意願,卻不等於可規模化需求。 要形成持續需求,錯誤損失必須可量化,任務要重複發生,組織內要有明確的預算負責人,Fusion 還必須持續勝過人工專家、強單模型和外部驗證。但盡調預算往往流向分析師與可信來源,安全預算流向專業審計,不可逆決策又發生得太少。

因此,我們不看好只做多模型 wrapper、默認運行 panel,或把靜態模型選擇算法當作護城河的公司。連接 API 容易複製,固定策略也會隨模型能力和價格變化迅速失效;如果不知道錯誤值多少、Fusion 實際改對了多少次,就無法為這份保險定價。更可能捕獲價值的是掌握真實結果的一方:網關和 agent 平台、垂直應用、工作流所有者,以及評測和可觀測性產品。它們知道錯誤成本,能觀察結果,也能優化觸發策略。真正難複製的不是 panel 名單,而是判斷何時不調用 Fusion。 市場驗證 公開市場尚不足以判斷 Fusion 的需求規模,但已經能看出它如何被使用。Perplexity Model Council 僅向每月 200 美元的 Max 用戶和 Enterprise Max 用戶開放,用戶在網頁端手動選擇三個模型,用於投資研究、複雜決策和信息驗證;公開用戶案例包括通過 browser automation 將 Model Council 接入股票研究流程。Hermes Mixture of Agents 則把 Fusion 做成 agent 中可選擇的虛擬模型:用戶可以通過 /moa 只升級一個困難問題,也可以在複雜 session 中持續啟用,由多個 reference models 提供分析,再由 aggregator 調用工具並完成任務。Hermes 後來降低默認fan-out 頻率,復用上一輪模型意見以控制成本。這些案例說明,Fusion 的真實需求集中在 research、debugging、review 和重要決策等低頻困難任務,典型使用方式是單模型遇到瓶頸後的主動升級,而不是默認開啟的高頻自動化流程。現有證據證明這種需求存在,但公開信息仍不足以判斷它能否形成獨立、規模化的付費市場。

五、Fusion 的未來

推理價格下降表面上利好 Fusion,但也會同步降低強單模型、路由和外部驗證的成本。Fusion 競爭的不是昨天的一次模型調用,而是不斷改善的下一代單模型與編排基線。

Cognition 的 Devin Fusion 展示了這場競爭的方向:把昂貴模型留給判斷環節,把可驗證、機械性的工作交給更便宜的模型。 廠商自測中,Fusion + Fable 5 的總分從57.0 小幅升至 57.6,平均成本從 5.12 美元降至 3.00 美元;但在公布的 5 個案例中,成本均下降 25%-62%,任務得分卻在 +12 至 -27 之間波動。 邊界清楚、測試充分的 ES6 重構從 98 分升至 100 分;依賴交互理解和隱含需求的 React/Redux 功能被錯誤委派後,則從 54 分跌至 27 分。

從提分到付費:Model Fusion 的需求錯覺 ▲ 圖 6:Devin Fusion 的任務得分與成本 這些是廠商挑選的案例,不代表總體分布,但指向清楚:未來多模型系統的核心能力不是調用更多模型,而是劃定正確的降級邊界。 可驗證、機械性的任務可以交給便宜模型,判斷密集型任務必須留給前沿模型。OpenRouter 出售"更多智能",Cognition 出售"同等智能,更低成本";第二種命題更接近長期方向。系統越接近生產經濟學,就越不像狹義的 Model Fusion,而越像路由、委派和驗證。

7 月下旬,媒體報導稱 Stripe 正洽談以約 100 億美元收購 OpenRouter,交易尚未確認。這個信號不應被解讀為 Fusion 已經獲得市場驗證:OpenRouter 的核心價值並非某一種 panel,而是連接超過 500 萬開發者與 400 多個模型的中立調用層。Stripe 已經為 OpenRouter 提供計費、稅務和風控,並允許開發者通過 Stripe Projects 直接創建賬戶、取得 API key 和接通付款。Stripe 真正可能購買的是 AI 推理的交易入口:OpenRouter 掌握模型選擇、token 用量與成本,Stripe 則處理定價、賬單和支付。 這為前文的價值判斷提供了市場信號:多模型時代的價值更可能留在能夠觀察任務、分配調用並完成結算的 orchestration layer,Fusion 只是其上的一種高成本升級策略。

未來的多模型系統不會默認召集 panel,而會先估計任務難度、驗證成本和錯誤損失;只有當更強單模型、延長推理和外部工具仍不足時,才進入多模型分歧搜索。觸發率、增量成功率和經驗證的單位結果成本,才是有意義的產品指標。Fusion 會作為低頻功能留下,而不是成為默認架構或獨立品類。

六、Sources

  • OpenRouter: Surpassing Frontier Performance with Fusion

  • OpenRouter Fusion Router documentation

  • Cognition: Devin Fusion --- Frontier Performance at 35% Lower Cost

  • Microsoft Research: Switchcraft --- AI Model Router for Agentic Tool Calling

  • When Does Combining Language Models Help?

  • Multi-Agent Reasoning Improves Compute Efficiency

  • Single-Agent LLMs Outperform Multi-Agent Systems on Multi-Hop Reasoning Under Equal Thinking Token Budgets

  • Mixture-of-Agents Enhances Large Language Model Capabilities

  • RouteLLM: Learning to Route LLMs with Preference Data

  • LitBench: A Benchmark for Creative-Writing Evaluation

  • Artificial Analysis model comparison

  • The Price of Progress: Price Performance and the Future of AI

  • Perplexity: What is Model Council?

  • Perplexity user example: Model Council for financial research

  • Hermes Agent: Mixture of Agents documentation

  • Stripe powers OpenRouterʼs global AI model access

  • Axios: Whatʼs behind Stripeʼs reported OpenRouter move

欢迎加入 ChainCatcher 官方社群
Telegram 订阅: @chaincatcher
X (Twitter): @ChainCatcher_
warnning 風險提示
app_icon
ChainCatcher 與創新者共建Web3世界