AI 推論服務與優化供應鏈 (AI Inference Serving & Optimization)
AI Inference Serving & Optimization — 推論即服務(賣 API/token)與優化軟體層(量化/KV cache/投機解碼,每 GPU 多服務 10–50x 請求)。2026 是推論層自成資產類別的引爆年:Fireworks 洽 $15B(ARR ~$8 億、每日 10+ 兆 token)、Baseten 2026-06-22 完成 $1.5B Series F 估值 $13B(ARR $600M、YoY +1,900%、每日 10 億+ 推論呼叫)、Together 2026-07 完成 $800M Series C 估值躍至 $8.3B(年化 bookings 逾 $11.5 億);Groq 遭 NVIDIA 約 $200 億 licence+acquihire(創辦人與約 90% 員工轉入 NVIDIA)並於 GTC 2026 落地為自有 Groq 3 LPX、Cerebras 已 IPO(2026-05 每股 $185 募 $55.5 億、首日衝至約 $950 億估值、OpenAI 採購倍增至逾 $200 億,Llama 70B 1,800+ tok/s);OpenRouter 估值 $1.3B、每週 25 兆 token 抽 ~5% 過路費;SGLang spin out 成 RadixArk($400M、Accel/NVIDIA 投)。市場 2025 $1,061 億→2030 $2,550 億(CAGR ~19%)。⚠ HBM 2026 全年售罄、推論將佔年底約 2/3 算力需求。價值鏈:推論晶片/加速器 → 推論引擎/優化(vLLM/SGLang/TensorRT-LLM/Dynamo)→ 推論即服務平台 → 聚合/路由 → 終端需求。⚠ 真正穩賺是引擎/優化與聚合兩個輕資產賣鏟人;押 GPU 平台毛利僅 ~50%。有別於 neocloud(賣裸機)、llmops_eval(監控)。
← 回 企業軟體 AI / 自動化 / 數位勞工 主題列表 · 回首頁
推論晶片 / 加速器(GPU / LPU / WSE / RDU) Inference Silicon & Accelerators
推論服務層的硬體底料:NVIDIA Blackwell/Hopper GPU 主導,加上 Groq LPU、Cerebras 晶圓級 WSE、SambaNova RDU、Google TPU 等專用推論加速器。這是整鏈成本結構(COGS)的核心。⚠ 2026 HBM 全年售罄、資料中心吃掉全球約 70% 記憶體晶片產能,OpenAI 點名記憶體短缺為訓練/推論首要瓶頸——此 memory wall 正是大片上 SRAM、避開 HBM 的 LPU/WSE 架構在 H1 取得結構性順風的根因。
【1 誰佔位+量化】NVIDIA(NVDA)居絕對領導:資料中心 AI 加速器 2024 峰值約 87%、2026 年約 80%、分析師估年底降至約 75%——份額下滑非賣不動,而是總量擴張快過任一對手能吃下的速度。【2 護城河類型】NVIDIA 護城河是『資本/產能門檻+軟體綁定+垂直整合』三疊:Blackwell B200/GB200 每 token 成本較 Hopper 降最高 10x(製程/成本壁壘),CUDA+TensorRT-LLM/Dynamo 鎖住開發者(技術/生態綁定),再以資產負債表戰略投資幾乎所有推論平台與引擎(通路綁定)。2026 GTC 更把對 Groq 的授權落地為自有『Groq 3 LPX』(Vera Rubin 平台、單系統 256 顆第三代 LPU、每晶片 500MB 片上 SRAM/150 TB/s 避開 HBM memory wall、宣稱兆參數模型每 MW 吞吐較 HBM GPU 高 35x、GA 2026 H2),把唯一具威脅的 LPU 架構直接收進產品線。【3 挑戰者可信度】AMD 為最強次強(merchant GPU 約 5–8%、CES 2026 發表 MI400 系列與 Helios 機櫃,每櫃 2.9 ExaFLOPS FP4/HBM4 432GB,OpenAI 承諾 6GW、累計約 12GW),是唯一有規模化替代路徑者;hyperscaler 自研 ASIC(Google TPU、AWS Trainium、Meta MTIA)合計 2026 目標約 10–15%,走『自用去 NVIDIA 化』路線;專用推論晶片 Cerebras(已 IPO、WSE 晶圓級 Llama 70B 1,800+ tok/s)、Groq(LPU)屬極速利基。【4 絃外之音風險】(a) Cerebras 客戶集中度極端——2025 約 86% 營收來自兩家 UAE 客戶(MBZUAI 62%+G42 24%),且 Q1 2026 首份財報 Q2 毛利率指引由 46.5% 驟降至 36–38%(因為 OpenAI 部署改採 leaseback、由賣晶片轉租算力),股價當日跌逾 10%——極速≠賺錢;(b) Groq 已被 NVIDIA 以約 $200 億『licence+acquihire』實質掏空:創辦人 Jonathan Ross、總裁與約 90% 員工轉入 NVIDIA,殘存 Groq 僅剩較小的獨立 LPU 雲,被部分參議員質疑為規避 HSR 反壟斷申報的 reverse acquihire;(c) NVIDIA 集中度既是護城河也是反壟斷把柄。
| 公司 | 市佔/地位 | 角色 |
|---|
| [US] NVIDIA (NVDA) | 推論加速器主導 ~75%(年底)+ 軟硬通吃 + 自有 LPU | Blackwell 較 Hopper 每 token 成本降最高 10x;GTC 2026 把 Groq 授權落地為 Groq 3 LPX(Vera Rubin、每 MW 吞吐 35x、GA H2 2026);市佔由 80–85% 降至年底約 75% |
| [US] Groq (—) | LPU 利基(已被 NVIDIA 實質收編) | 未上市;LPU 500–1,000+ tok/s;2025-12 NVIDIA 以約 $200 億 licence+acquihire——創辦人 Ross、總裁及約 90% 員工轉入 NVIDIA、股東 85% 現金上付/10% 年中/餘尾付;殘存為較小獨立 LPU 雲、Simon Edwards 任 CEO;LPU 授權落地成 NVIDIA Groq 3 LPX |
| [US] Cerebras Systems (CBRS) | 晶圓級 WSE 極速推論 / 已 IPO | 2026-05-13 每股 $185 募 $55.5 億、首日收 $311.07(+68%)估值約 $950 億;2025 營收 $510M(+76%,約 86% 來自兩家 UAE 客戶 MBZUAI 62%+G42 24%);OpenAI 採購逾 $200 億(750MW)+認股權證最高 10%;⚠ Q1 2026 首份財報營收 $191M(+92%)、FY 指引升至 $855–865M,但 Q2 毛利率指引由 46.5% 驟降至 36–38%(OpenAI leaseback),股價當日跌逾 10%;Llama 70B 1,800+ tok/s;2026-03 進 Bedrock |
| [US] SambaNova (—) | RDU 可重構資料流(追趕者) | 未上市;Intel 收購案(曾傳 $16 億)2026-02 破局,改為 $350M Series E+Intel 策略投資與多年合作(Vista/Cambium 領投、Intel Capital 及 Qatar/Saudi 主權基金參投;SambaNova Cloud 建於 Intel Xeon);SN50 約 GPU 三倍 token 速 |
| [US] AMD (AMD) | GPU 推論替代(市佔升) | CES 2026 發表 MI400/Helios(每櫃 2.9 ExaFLOPS FP4、HBM4 432GB);OpenAI 承諾 6GW、累計約 12GW;投資 RadixArk/Cerebras |
| [US] Google (GOOGL) | TPU 自用 + 雲端 | 自有 TPU 推論;2026 與 Marvell 洽開發 MPU + 推論最佳化 TPU(Broadcom/MediaTek 外第三家設計夥伴);CapitalG 領投 OpenRouter |
| [US] Marvell (MRVL) | 客製 AI ASIC 協同設計 ~35% | 2026 與 Google 洽共同開發 MPU + 推論最佳化 TPU;客製矽年化營收約 $15 億、18 個雲端設計案;Amazon Trainium 3 2026 Q2 量產 |
資料來源
推論引擎 / 優化軟體(賣鏟人核心) Inference Engine & Optimization
把模型「跑得快、跑得省」的開源推論引擎與優化軟體:vLLM、SGLang、TensorRT-LLM、Dynamo 編排層,加上量化/KV cache/投機解碼等優化技術。這是整鏈真正的軟體護城河與最務實的賣鏟人環節。
【1 誰佔位+量化】vLLM 為事實標準開源引擎:PagedAttention/continuous batching 是生產部署的預設,跑在 Meta/Mistral/Cohere/IBM/Red Hat;SGLang(→RadixArk)為最快追趕者,已部署 40 萬+ GPU(含 xAI/Google/Microsoft/Oracle/Nebius/LinkedIn/Thinking Machines)。組合優化(量化+KV cache+投機解碼+prefix/continuous batching)可較 naive 多服務 10–50x 請求/GPU——這是整鏈真正的軟體護城河。【2 護城河類型】此環節護城河是『開源社群網路效應+技術壁壘』而非資本:一旦成為事實標準,模型作者與硬體商都圍著它做最佳化(正回饋),後進者難以撼動 vLLM 的預設地位;RadixArk 靠 SGLang 創辦人(xAI/NVIDIA 出身)的稀缺人才與 RadixAttention 技術差異化。【3 挑戰者可信度】三方角力:vLLM(Red Hat/IBM 商業化、中立開源)vs SGLang/RadixArk($400M、2026-05 $100M 種子 Accel/Spark 領投、NVIDIA/AMD/MediaTek 參投——罕見晶片三巨頭同時押注)vs NVIDIA 自家 TensorRT-LLM+Dynamo(2026-03 GA 分散式編排、prefill/decode 解耦,GB300 NVL72 達 $0.123/百萬 token、每 MW 吞吐較 Hopper +50x);NVIDIA 走『上層編排 vLLM/SGLang、下層鎖 GPU』的中立包抄。【4 絃外之音風險】(a) 開源引擎本身難直接變現——RadixArk/vLLM 的商業模式(託管/企業支援)仍未證明能撐起估值,價值多被上游 GPU 與下游平台捕獲;(b) NVIDIA 同時是最大金主(投 RadixArk)與最大競爭者(Dynamo/TensorRT-LLM),可透過 NVFP4 等 Blackwell 專用格式把最佳化紅利綁回自家硬體,稀釋開源引擎的硬體中立性。定位:vLLM 領導/事實標準、SGLang-RadixArk 次強追趕、NVIDIA TensorRT-LLM+Dynamo 為 GPU 綁定的並行主力、LMCache(配 vLLM 吞吐最高 15x)/Neural Magic(Red Hat)/Google TurboQuant 為優化利基。
| 公司 | 市佔/地位 | 角色 |
|---|
| [US] vLLM (Red Hat / IBM) (IBM) | 事實標準開源引擎 | 生產部署於 Meta/Mistral/Cohere/IBM;Red Hat 商業化(IBM 旗下) |
| [US] RadixArk (SGLang) (—) | 開源引擎商業化新星 | 未上市 $400M;2026-05 $100M 種子(Accel/Spark/NVIDIA/AMD/MediaTek);部署 40 萬+ GPU |
| [US] NVIDIA (TensorRT-LLM / Dynamo) (NVDA) | GPU 專用引擎 + 編排層 | Dynamo 1.0 2026-03-16 GTC GA;prefill/decode 解耦 + NIXL KV 傳輸;GB300 NVL72 達 $0.123/百萬 token、較 Hopper 每 MW 吞吐 +50x;Meta/LinkedIn/Mistral/HuggingFace 已生產用 |
| [US] LMCache (—) | KV cache 優化層 | 未上市/開源;配 vLLM 吞吐最高 15x(多輪問答/長文件) |
| [US] Neural Magic (Red Hat) (IBM) | 稀疏化/量化優化 | 被 Red Hat 收購;剪枝/量化/稀疏推論 |
| [US] Google (TurboQuant) (GOOGL) | 極端壓縮研究 | 零精度損失極端壓縮;研究級 |
資料來源
推論即服務平台(IaaS,敘事核心) Inference-as-a-Service Platforms
賣 API/token 的推論即服務平台,是 2026 投資熱度最高的敘事核心。ARR 單季翻倍、估值半年翻倍,但 GPU 成本嵌入 COGS 致毛利僅 ~50%,且面臨 hyperscaler 收編壓力。
【1 誰佔位+量化】無單一龍頭、由三家高 ARR 平台領跑:Together AI(2026-07-01 完成 $800M Series C、估值由 3 月洽的 $7.5B 升至 $8.3B、Aramco Ventures 領投 NVIDIA 參投;年化 bookings 逾 $11.5 億——實為 neocloud,API 僅占 30–40%、其餘 GPU 租賃)、Fireworks AI(洽 $15B、7 個月前才 $4B;ARR ~$8 億、每日 10+ 兆 token;FireAttention 自研核心)、Baseten($13B、2026-06-22 完成 $1.5B Series F;ARR $600M、YoY +1,900%、每日 10 億+ 呼叫跨 87 叢集/18 雲)。【2 護城河類型】此環節護城河『最弱』:主要靠(a) 自研推論核心的技術壁壘(Fireworks FireAttention、Baseten 多雲編排)、(b) 客戶遷移成本與端點穩定性綁定(Cursor/Perplexity/Notion 一旦上線不輕易換)、(c) 開源模型的『可代跑』空間;但底層 GPU 成本直接嵌 COGS,缺乏結構性壁壘。【3 挑戰者可信度】競爭三面夾擊:橫向同儕彼此殺價(DeepInfra 2026-05 $107M Series B、開源模型專屬雲營收翻三倍;Modal ~$4.5B、serverless)、上游晶片商自營雲往下打(Cerebras/Groq/SambaNova Cloud 以極速差異化)、最致命是 hyperscaler(AWS Bedrock/Azure/GCP)挾既有企業合約把推論拉回自家平台。【4 絃外之音風險】毛利僅 ~50%(遠低於 SaaS 70%+)是本環節結構性軟肋——per-token 價格 10–100x 崩跌、大客戶內製化(OpenAI 自建、企業自架 vLLM/SGLang)可直接繞過平台;估值半年翻倍隱含『ARR 成長必須永遠跑贏毛利壓縮』的脆弱假設,一旦 token 單價戰觸底或大客戶抽單,$13–15B 估值缺乏獲利支撐。定位:Together/Fireworks/Baseten 為領導群、DeepInfra/Modal 為次強、晶片商自營雲為利基差異化、hyperscaler 為收編威脅。
| 公司 | 市佔/地位 | 角色 |
|---|
| [US] Together AI (—) | IaaS/neocloud bookings 領先 | 未上市 $8.3B(2026-07-01 完成 $800M Series C、Aramco Ventures 領投、NVIDIA/Vista/General Catalyst 參投);年化 bookings 逾 $11.5 億;API 僅占 30–40%、其餘 GPU 租賃(neocloud 屬性) |
| [US] Fireworks AI (—) | 估值最高洽談中 | 未上市、洽 $15B;ARR ~$8 億、每日 10+ 兆 token;Cursor/Perplexity/Notion/Uber;毛利 ~50% |
| [US] Baseten (—) | ARR 增速最猛 | 未上市 $13B(2026-06-22 完成 $1.5B Series F、Altimeter/Conviction/Spark 領投、兩檔 $13B/$11B;18 個月第四輪);ARR $600M、YoY +1,900%(20x)、推論量 +40x;每日 10 億+ 推論呼叫跨 87 叢集/18 雲;客戶省 30% 成本 |
| [US] DeepInfra (—) | 開源模型專屬推論雲 | 未上市;2026-05 $107M Series B(NVIDIA 參投);營收 2026 初翻三倍 |
| [US] Modal Labs (—) | serverless GPU 推論 | 未上市 ~$4.5B 洽談;ARR ~$3 億;2026-05 完成 $355M |
| [US] Cerebras Cloud (CBRS) | 晶片商自營極速雲 | 2026-05 已 IPO(估值約 $950 億);WSE 晶圓級極速;OpenAI 採購逾 $200 億跑 ChatGPT 部分推論;2026-03 進 Amazon Bedrock |
| [US] Groq Cloud (—) | LPU 自營推論雲(母體被 NVIDIA 收編後殘存) | 未上市;LPU 極速、GPU 5–14x token 速;2025-12 NVIDIA 以約 $200 億 licence+acquihire 後為較小獨立實體(Simon Edwards 任 CEO),LPU 授權落地為 NVIDIA Groq 3 LPX |
資料來源
聚合 / 路由 / 網關(過路費商業模式) Aggregator, Router & Gateway
把多家模型/平台統一成單一 API 的聚合與路由網關,以「過路費」抽成,是另一個輕資產賣鏟人環節。隨多模型多供應商生態擴張,路由 token 量爆增。
【1 誰佔位+量化】OpenRouter 為聚合路由領導:400+ 模型/60+ provider 統一 API、每週 token 量半年由 5 兆暴增至 25 兆、抽約 5% 過路費;2026-05 完成 $113M Series B、估值一年翻倍至 $1.3B(CapitalG 領投、NVentures/a16z/Menlo 參投)、服務 800 萬+ 開發者。【2 護城河類型】護城河是『網路效應+轉換成本』:越多 provider 接入越多開發者,越多開發者越吸引 provider,單一 API 抽象掉多供應商的計費/故障轉移/模型選擇——開發者一旦把路由層寫進程式就有黏性。輕資產(不持有 GPU)故毛利結構優於 IaaS 平台。【3 挑戰者可信度】競爭來自三側:Cloudflare(2025-11 收 Replicate 併入 Workers AI,以邊緣+海量模型庫切入)、垂直折扣市集(Novita serverless+spot GPU、Hyperbolic 折扣 GPU、Featherless flat-rate 25,000+ 模型),以及最結構性的 hyperscaler 自帶網關(Bedrock/Vertex 模型花園)。【4 絃外之音風險】OpenRouter 的核心悖論是『正在侵蝕自己的存在理由』——它把 provider 商品化、讓比價透明,反促使大客戶與模型/平台直連去中介化;一旦某模型或平台流量夠大,繞過路由層省下 5% 抽成的誘因就浮現,且 hyperscaler 可用既有雲合約把路由內建、零邊際成本擠壓過路費。定位:OpenRouter 領導、Cloudflare 為挾邊緣網路的次強、折扣市集為利基、hyperscaler 網關為收編威脅。
| 公司 | 市佔/地位 | 角色 |
|---|
| [US] OpenRouter (—) | 聚合路由領導 | 未上市 $1.3B;每週 25 兆 token 抽 ~5%;2026-05 $113M(CapitalG/NVentures/a16z) |
| [US] Cloudflare (NET) | 邊緣推論 + 模型庫 | 2025-11 收 Replicate 整併進 Workers AI 邊緣推論 |
| [SG] Novita AI (—) | serverless + spot GPU | 未上市;H100/H200/RTX5090 按秒計費 |
| [US] Hyperbolic (—) | 折扣 GPU 推論 | 未上市;低價 GPU 推論市集 |
| [US] Featherless AI (—) | flat-rate 推論 | 未上市;固定費率取代 per-token |
資料來源
終端需求(應用 / 企業 / 開源模型方) Application & Enterprise Demand
推論服務的需求端:AI 原生應用、超大規模/企業,以及提供可代跑權重的開源模型方。agentic 工作流每任務吃 5–30x token,是推論 token 結構性暴增的根因。
推論已成 AI 算力支出主軸:多方估計推論將佔 2026 年底約三分之二 AI 算力需求(2023 約三分之一),是 OpenAI 同時與 Cerebras/Groq/AMD 簽巨額推論合約的結構性背景。AI 原生應用:Cursor、Perplexity、Notion、Uber、Mercor、OpenEvidence——per-token 價格 10–100x 壓縮,但 agentic 用量 5–30x 暴增,總帳單反增、推論量結構性成長。超大規模/企業:Microsoft(MSFT)、Google(GOOGL)、AWS(AMZN,自有推論 + 收編壓力,把推論支出拉回自家平台;Trainium 3 2026 Q2 量產加速去 NVIDIA 化)、OpenAI(2026-04 將 Cerebras 採購倍增至逾 $200 億並取得最高 10% 認股權證、承諾 AMD 6GW)。開源模型方是第三方推論平台命脈(閉源 API 無第三方代跑空間):Mistral(ARR ~$400M 2026-01、目標年底 >$10 億)、Meta Llama、DeepSeek、Qwen(阿里)、Kimi(月之暗面)。⚠ 大客戶內製化(OpenAI 自建、企業自架 vLLM)可繞過第三方平台,侵蝕 IaaS 需求;hyperscaler 同時是需求方與競爭方。
| 公司 | 市佔/地位 | 角色 |
|---|
| [US] OpenAI (—) | 最大推論需求/合約方 | 未上市;2026-04 Cerebras 採購由 $100 億倍增至逾 $200 億(750MW+認股權證最高 10%+$10 億資料中心資金);承諾 AMD 6GW;自建推論基建是內製化威脅 |
| [FR] Mistral AI (—) | 歐洲開源模型方 | 未上市;ARR ~$400M 2026-01、目標年底 >$10 億 |
| [US] Microsoft (MSFT) | 超大規模需求+競爭 | 自有推論 + 把支出拉回自家平台壓力 |
| [US] Amazon (AWS) (AMZN) | 雲端需求+收編方+自研矽 | 2026-03 把 Cerebras 納 Bedrock;Trainium 3 2026 Q2 量產加速去 NVIDIA 化;hyperscaler 收編壓力 |
| [US] Perplexity (—) | AI 原生應用客戶 | 未上市;Fireworks 客戶;agentic 高 token 用量 |
| [US] Cursor (Anysphere) (—) | coding agent 客戶 | 未上市;多平台客戶;coding agent token 用量大 |
資料來源
💬 留言討論 (0)
歡迎分享你對此供應鏈/個股的看法。需以 Google 帳號登入後留言;內容僅供研究討論,非投資建議。