半導體供應鏈互動地圖

AI 推論服務與優化供應鏈 (AI Inference Serving & Optimization)

AI Inference Serving & Optimization — 推論即服務(賣 API/token)與優化軟體層(量化/KV cache/投機解碼,每 GPU 多服務 10–50x 請求)。2026 是推論層自成資產類別的引爆年:Fireworks 洽 $15B(ARR ~$8 億、每日 10+ 兆 token)、Baseten 2026-06-22 完成 $1.5B Series F 估值 $13B(ARR $600M、YoY +1,900%、每日 10 億+ 推論呼叫)、Together 2026-07 完成 $800M Series C 估值躍至 $8.3B(年化 bookings 逾 $11.5 億);Groq 遭 NVIDIA 約 $200 億 licence+acquihire(創辦人與約 90% 員工轉入 NVIDIA)並於 GTC 2026 落地為自有 Groq 3 LPX、Cerebras 已 IPO(2026-05 每股 $185 募 $55.5 億、首日衝至約 $950 億估值、OpenAI 採購倍增至逾 $200 億,Llama 70B 1,800+ tok/s);OpenRouter 估值 $1.3B、每週 25 兆 token 抽 ~5% 過路費;SGLang spin out 成 RadixArk($400M、Accel/NVIDIA 投)。市場 2025 $1,061 億→2030 $2,550 億(CAGR ~19%)。⚠ HBM 2026 全年售罄、推論將佔年底約 2/3 算力需求。價值鏈:推論晶片/加速器 → 推論引擎/優化(vLLM/SGLang/TensorRT-LLM/Dynamo)→ 推論即服務平台 → 聚合/路由 → 終端需求。⚠ 真正穩賺是引擎/優化與聚合兩個輕資產賣鏟人;押 GPU 平台毛利僅 ~50%。有別於 neocloud(賣裸機)、llmops_eval(監控)。

← 回 企業軟體 AI / 自動化 / 數位勞工 主題列表 · 回首頁

推論晶片 / 加速器(GPU / LPU / WSE / RDU) Inference Silicon & Accelerators

推論服務層的硬體底料:NVIDIA Blackwell/Hopper GPU 主導,加上 Groq LPU、Cerebras 晶圓級 WSE、SambaNova RDU、Google TPU 等專用推論加速器。這是整鏈成本結構(COGS)的核心。⚠ 2026 HBM 全年售罄、資料中心吃掉全球約 70% 記憶體晶片產能,OpenAI 點名記憶體短缺為訓練/推論首要瓶頸——此 memory wall 正是大片上 SRAM、避開 HBM 的 LPU/WSE 架構在 H1 取得結構性順風的根因。

【1 誰佔位+量化】NVIDIA(NVDA)居絕對領導:資料中心 AI 加速器 2024 峰值約 87%、2026 年約 80%、分析師估年底降至約 75%——份額下滑非賣不動,而是總量擴張快過任一對手能吃下的速度。【2 護城河類型】NVIDIA 護城河是『資本/產能門檻+軟體綁定+垂直整合』三疊:Blackwell B200/GB200 每 token 成本較 Hopper 降最高 10x(製程/成本壁壘),CUDA+TensorRT-LLM/Dynamo 鎖住開發者(技術/生態綁定),再以資產負債表戰略投資幾乎所有推論平台與引擎(通路綁定)。2026 GTC 更把對 Groq 的授權落地為自有『Groq 3 LPX』(Vera Rubin 平台、單系統 256 顆第三代 LPU、每晶片 500MB 片上 SRAM/150 TB/s 避開 HBM memory wall、宣稱兆參數模型每 MW 吞吐較 HBM GPU 高 35x、GA 2026 H2),把唯一具威脅的 LPU 架構直接收進產品線。【3 挑戰者可信度】AMD 為最強次強(merchant GPU 約 5–8%、CES 2026 發表 MI400 系列與 Helios 機櫃,每櫃 2.9 ExaFLOPS FP4/HBM4 432GB,OpenAI 承諾 6GW、累計約 12GW),是唯一有規模化替代路徑者;hyperscaler 自研 ASIC(Google TPU、AWS Trainium、Meta MTIA)合計 2026 目標約 10–15%,走『自用去 NVIDIA 化』路線;專用推論晶片 Cerebras(已 IPO、WSE 晶圓級 Llama 70B 1,800+ tok/s)、Groq(LPU)屬極速利基。【4 絃外之音風險】(a) Cerebras 客戶集中度極端——2025 約 86% 營收來自兩家 UAE 客戶(MBZUAI 62%+G42 24%),且 Q1 2026 首份財報 Q2 毛利率指引由 46.5% 驟降至 36–38%(因為 OpenAI 部署改採 leaseback、由賣晶片轉租算力),股價當日跌逾 10%——極速≠賺錢;(b) Groq 已被 NVIDIA 以約 $200 億『licence+acquihire』實質掏空:創辦人 Jonathan Ross、總裁與約 90% 員工轉入 NVIDIA,殘存 Groq 僅剩較小的獨立 LPU 雲,被部分參議員質疑為規避 HSR 反壟斷申報的 reverse acquihire;(c) NVIDIA 集中度既是護城河也是反壟斷把柄。

公司市佔/地位角色
[US] NVIDIA (NVDA)推論加速器主導 ~75%(年底)+ 軟硬通吃 + 自有 LPUBlackwell 較 Hopper 每 token 成本降最高 10x;GTC 2026 把 Groq 授權落地為 Groq 3 LPX(Vera Rubin、每 MW 吞吐 35x、GA H2 2026);市佔由 80–85% 降至年底約 75%
[US] Groq (—)LPU 利基(已被 NVIDIA 實質收編)未上市;LPU 500–1,000+ tok/s;2025-12 NVIDIA 以約 $200 億 licence+acquihire——創辦人 Ross、總裁及約 90% 員工轉入 NVIDIA、股東 85% 現金上付/10% 年中/餘尾付;殘存為較小獨立 LPU 雲、Simon Edwards 任 CEO;LPU 授權落地成 NVIDIA Groq 3 LPX
[US] Cerebras Systems (CBRS)晶圓級 WSE 極速推論 / 已 IPO2026-05-13 每股 $185 募 $55.5 億、首日收 $311.07(+68%)估值約 $950 億;2025 營收 $510M(+76%,約 86% 來自兩家 UAE 客戶 MBZUAI 62%+G42 24%);OpenAI 採購逾 $200 億(750MW)+認股權證最高 10%;⚠ Q1 2026 首份財報營收 $191M(+92%)、FY 指引升至 $855–865M,但 Q2 毛利率指引由 46.5% 驟降至 36–38%(OpenAI leaseback),股價當日跌逾 10%;Llama 70B 1,800+ tok/s;2026-03 進 Bedrock
[US] SambaNova (—)RDU 可重構資料流(追趕者)未上市;Intel 收購案(曾傳 $16 億)2026-02 破局,改為 $350M Series E+Intel 策略投資與多年合作(Vista/Cambium 領投、Intel Capital 及 Qatar/Saudi 主權基金參投;SambaNova Cloud 建於 Intel Xeon);SN50 約 GPU 三倍 token 速
[US] AMD (AMD)GPU 推論替代(市佔升)CES 2026 發表 MI400/Helios(每櫃 2.9 ExaFLOPS FP4、HBM4 432GB);OpenAI 承諾 6GW、累計約 12GW;投資 RadixArk/Cerebras
[US] Google (GOOGL)TPU 自用 + 雲端自有 TPU 推論;2026 與 Marvell 洽開發 MPU + 推論最佳化 TPU(Broadcom/MediaTek 外第三家設計夥伴);CapitalG 領投 OpenRouter
[US] Marvell (MRVL)客製 AI ASIC 協同設計 ~35%2026 與 Google 洽共同開發 MPU + 推論最佳化 TPU;客製矽年化營收約 $15 億、18 個雲端設計案;Amazon Trainium 3 2026 Q2 量產

資料來源

推論引擎 / 優化軟體(賣鏟人核心) Inference Engine & Optimization

把模型「跑得快、跑得省」的開源推論引擎與優化軟體:vLLM、SGLang、TensorRT-LLM、Dynamo 編排層,加上量化/KV cache/投機解碼等優化技術。這是整鏈真正的軟體護城河與最務實的賣鏟人環節。

【1 誰佔位+量化】vLLM 為事實標準開源引擎:PagedAttention/continuous batching 是生產部署的預設,跑在 Meta/Mistral/Cohere/IBM/Red Hat;SGLang(→RadixArk)為最快追趕者,已部署 40 萬+ GPU(含 xAI/Google/Microsoft/Oracle/Nebius/LinkedIn/Thinking Machines)。組合優化(量化+KV cache+投機解碼+prefix/continuous batching)可較 naive 多服務 10–50x 請求/GPU——這是整鏈真正的軟體護城河。【2 護城河類型】此環節護城河是『開源社群網路效應+技術壁壘』而非資本:一旦成為事實標準,模型作者與硬體商都圍著它做最佳化(正回饋),後進者難以撼動 vLLM 的預設地位;RadixArk 靠 SGLang 創辦人(xAI/NVIDIA 出身)的稀缺人才與 RadixAttention 技術差異化。【3 挑戰者可信度】三方角力:vLLM(Red Hat/IBM 商業化、中立開源)vs SGLang/RadixArk($400M、2026-05 $100M 種子 Accel/Spark 領投、NVIDIA/AMD/MediaTek 參投——罕見晶片三巨頭同時押注)vs NVIDIA 自家 TensorRT-LLM+Dynamo(2026-03 GA 分散式編排、prefill/decode 解耦,GB300 NVL72 達 $0.123/百萬 token、每 MW 吞吐較 Hopper +50x);NVIDIA 走『上層編排 vLLM/SGLang、下層鎖 GPU』的中立包抄。【4 絃外之音風險】(a) 開源引擎本身難直接變現——RadixArk/vLLM 的商業模式(託管/企業支援)仍未證明能撐起估值,價值多被上游 GPU 與下游平台捕獲;(b) NVIDIA 同時是最大金主(投 RadixArk)與最大競爭者(Dynamo/TensorRT-LLM),可透過 NVFP4 等 Blackwell 專用格式把最佳化紅利綁回自家硬體,稀釋開源引擎的硬體中立性。定位:vLLM 領導/事實標準、SGLang-RadixArk 次強追趕、NVIDIA TensorRT-LLM+Dynamo 為 GPU 綁定的並行主力、LMCache(配 vLLM 吞吐最高 15x)/Neural Magic(Red Hat)/Google TurboQuant 為優化利基。

公司市佔/地位角色
[US] vLLM (Red Hat / IBM) (IBM)事實標準開源引擎生產部署於 Meta/Mistral/Cohere/IBM;Red Hat 商業化(IBM 旗下)
[US] RadixArk (SGLang) (—)開源引擎商業化新星未上市 $400M;2026-05 $100M 種子(Accel/Spark/NVIDIA/AMD/MediaTek);部署 40 萬+ GPU
[US] NVIDIA (TensorRT-LLM / Dynamo) (NVDA)GPU 專用引擎 + 編排層Dynamo 1.0 2026-03-16 GTC GA;prefill/decode 解耦 + NIXL KV 傳輸;GB300 NVL72 達 $0.123/百萬 token、較 Hopper 每 MW 吞吐 +50x;Meta/LinkedIn/Mistral/HuggingFace 已生產用
[US] LMCache (—)KV cache 優化層未上市/開源;配 vLLM 吞吐最高 15x(多輪問答/長文件)
[US] Neural Magic (Red Hat) (IBM)稀疏化/量化優化被 Red Hat 收購;剪枝/量化/稀疏推論
[US] Google (TurboQuant) (GOOGL)極端壓縮研究零精度損失極端壓縮;研究級

資料來源

推論即服務平台(IaaS,敘事核心) Inference-as-a-Service Platforms

賣 API/token 的推論即服務平台,是 2026 投資熱度最高的敘事核心。ARR 單季翻倍、估值半年翻倍,但 GPU 成本嵌入 COGS 致毛利僅 ~50%,且面臨 hyperscaler 收編壓力。

【1 誰佔位+量化】無單一龍頭、由三家高 ARR 平台領跑:Together AI(2026-07-01 完成 $800M Series C、估值由 3 月洽的 $7.5B 升至 $8.3B、Aramco Ventures 領投 NVIDIA 參投;年化 bookings 逾 $11.5 億——實為 neocloud,API 僅占 30–40%、其餘 GPU 租賃)、Fireworks AI(洽 $15B、7 個月前才 $4B;ARR ~$8 億、每日 10+ 兆 token;FireAttention 自研核心)、Baseten($13B、2026-06-22 完成 $1.5B Series F;ARR $600M、YoY +1,900%、每日 10 億+ 呼叫跨 87 叢集/18 雲)。【2 護城河類型】此環節護城河『最弱』:主要靠(a) 自研推論核心的技術壁壘(Fireworks FireAttention、Baseten 多雲編排)、(b) 客戶遷移成本與端點穩定性綁定(Cursor/Perplexity/Notion 一旦上線不輕易換)、(c) 開源模型的『可代跑』空間;但底層 GPU 成本直接嵌 COGS,缺乏結構性壁壘。【3 挑戰者可信度】競爭三面夾擊:橫向同儕彼此殺價(DeepInfra 2026-05 $107M Series B、開源模型專屬雲營收翻三倍;Modal ~$4.5B、serverless)、上游晶片商自營雲往下打(Cerebras/Groq/SambaNova Cloud 以極速差異化)、最致命是 hyperscaler(AWS Bedrock/Azure/GCP)挾既有企業合約把推論拉回自家平台。【4 絃外之音風險】毛利僅 ~50%(遠低於 SaaS 70%+)是本環節結構性軟肋——per-token 價格 10–100x 崩跌、大客戶內製化(OpenAI 自建、企業自架 vLLM/SGLang)可直接繞過平台;估值半年翻倍隱含『ARR 成長必須永遠跑贏毛利壓縮』的脆弱假設,一旦 token 單價戰觸底或大客戶抽單,$13–15B 估值缺乏獲利支撐。定位:Together/Fireworks/Baseten 為領導群、DeepInfra/Modal 為次強、晶片商自營雲為利基差異化、hyperscaler 為收編威脅。

公司市佔/地位角色
[US] Together AI (—)IaaS/neocloud bookings 領先未上市 $8.3B(2026-07-01 完成 $800M Series C、Aramco Ventures 領投、NVIDIA/Vista/General Catalyst 參投);年化 bookings 逾 $11.5 億;API 僅占 30–40%、其餘 GPU 租賃(neocloud 屬性)
[US] Fireworks AI (—)估值最高洽談中未上市、洽 $15B;ARR ~$8 億、每日 10+ 兆 token;Cursor/Perplexity/Notion/Uber;毛利 ~50%
[US] Baseten (—)ARR 增速最猛未上市 $13B(2026-06-22 完成 $1.5B Series F、Altimeter/Conviction/Spark 領投、兩檔 $13B/$11B;18 個月第四輪);ARR $600M、YoY +1,900%(20x)、推論量 +40x;每日 10 億+ 推論呼叫跨 87 叢集/18 雲;客戶省 30% 成本
[US] DeepInfra (—)開源模型專屬推論雲未上市;2026-05 $107M Series B(NVIDIA 參投);營收 2026 初翻三倍
[US] Modal Labs (—)serverless GPU 推論未上市 ~$4.5B 洽談;ARR ~$3 億;2026-05 完成 $355M
[US] Cerebras Cloud (CBRS)晶片商自營極速雲2026-05 已 IPO(估值約 $950 億);WSE 晶圓級極速;OpenAI 採購逾 $200 億跑 ChatGPT 部分推論;2026-03 進 Amazon Bedrock
[US] Groq Cloud (—)LPU 自營推論雲(母體被 NVIDIA 收編後殘存)未上市;LPU 極速、GPU 5–14x token 速;2025-12 NVIDIA 以約 $200 億 licence+acquihire 後為較小獨立實體(Simon Edwards 任 CEO),LPU 授權落地為 NVIDIA Groq 3 LPX

資料來源

聚合 / 路由 / 網關(過路費商業模式) Aggregator, Router & Gateway

把多家模型/平台統一成單一 API 的聚合與路由網關,以「過路費」抽成,是另一個輕資產賣鏟人環節。隨多模型多供應商生態擴張,路由 token 量爆增。

【1 誰佔位+量化】OpenRouter 為聚合路由領導:400+ 模型/60+ provider 統一 API、每週 token 量半年由 5 兆暴增至 25 兆、抽約 5% 過路費;2026-05 完成 $113M Series B、估值一年翻倍至 $1.3B(CapitalG 領投、NVentures/a16z/Menlo 參投)、服務 800 萬+ 開發者。【2 護城河類型】護城河是『網路效應+轉換成本』:越多 provider 接入越多開發者,越多開發者越吸引 provider,單一 API 抽象掉多供應商的計費/故障轉移/模型選擇——開發者一旦把路由層寫進程式就有黏性。輕資產(不持有 GPU)故毛利結構優於 IaaS 平台。【3 挑戰者可信度】競爭來自三側:Cloudflare(2025-11 收 Replicate 併入 Workers AI,以邊緣+海量模型庫切入)、垂直折扣市集(Novita serverless+spot GPU、Hyperbolic 折扣 GPU、Featherless flat-rate 25,000+ 模型),以及最結構性的 hyperscaler 自帶網關(Bedrock/Vertex 模型花園)。【4 絃外之音風險】OpenRouter 的核心悖論是『正在侵蝕自己的存在理由』——它把 provider 商品化、讓比價透明,反促使大客戶與模型/平台直連去中介化;一旦某模型或平台流量夠大,繞過路由層省下 5% 抽成的誘因就浮現,且 hyperscaler 可用既有雲合約把路由內建、零邊際成本擠壓過路費。定位:OpenRouter 領導、Cloudflare 為挾邊緣網路的次強、折扣市集為利基、hyperscaler 網關為收編威脅。

公司市佔/地位角色
[US] OpenRouter (—)聚合路由領導未上市 $1.3B;每週 25 兆 token 抽 ~5%;2026-05 $113M(CapitalG/NVentures/a16z)
[US] Cloudflare (NET)邊緣推論 + 模型庫2025-11 收 Replicate 整併進 Workers AI 邊緣推論
[SG] Novita AI (—)serverless + spot GPU未上市;H100/H200/RTX5090 按秒計費
[US] Hyperbolic (—)折扣 GPU 推論未上市;低價 GPU 推論市集
[US] Featherless AI (—)flat-rate 推論未上市;固定費率取代 per-token

資料來源

終端需求(應用 / 企業 / 開源模型方) Application & Enterprise Demand

推論服務的需求端:AI 原生應用、超大規模/企業,以及提供可代跑權重的開源模型方。agentic 工作流每任務吃 5–30x token,是推論 token 結構性暴增的根因。

推論已成 AI 算力支出主軸:多方估計推論將佔 2026 年底約三分之二 AI 算力需求(2023 約三分之一),是 OpenAI 同時與 Cerebras/Groq/AMD 簽巨額推論合約的結構性背景。AI 原生應用:Cursor、Perplexity、Notion、Uber、Mercor、OpenEvidence——per-token 價格 10–100x 壓縮,但 agentic 用量 5–30x 暴增,總帳單反增、推論量結構性成長。超大規模/企業:Microsoft(MSFT)、Google(GOOGL)、AWS(AMZN,自有推論 + 收編壓力,把推論支出拉回自家平台;Trainium 3 2026 Q2 量產加速去 NVIDIA 化)、OpenAI(2026-04 將 Cerebras 採購倍增至逾 $200 億並取得最高 10% 認股權證、承諾 AMD 6GW)。開源模型方是第三方推論平台命脈(閉源 API 無第三方代跑空間):Mistral(ARR ~$400M 2026-01、目標年底 >$10 億)、Meta Llama、DeepSeek、Qwen(阿里)、Kimi(月之暗面)。⚠ 大客戶內製化(OpenAI 自建、企業自架 vLLM)可繞過第三方平台,侵蝕 IaaS 需求;hyperscaler 同時是需求方與競爭方。

公司市佔/地位角色
[US] OpenAI (—)最大推論需求/合約方未上市;2026-04 Cerebras 採購由 $100 億倍增至逾 $200 億(750MW+認股權證最高 10%+$10 億資料中心資金);承諾 AMD 6GW;自建推論基建是內製化威脅
[FR] Mistral AI (—)歐洲開源模型方未上市;ARR ~$400M 2026-01、目標年底 >$10 億
[US] Microsoft (MSFT)超大規模需求+競爭自有推論 + 把支出拉回自家平台壓力
[US] Amazon (AWS) (AMZN)雲端需求+收編方+自研矽2026-03 把 Cerebras 納 Bedrock;Trainium 3 2026 Q2 量產加速去 NVIDIA 化;hyperscaler 收編壓力
[US] Perplexity (—)AI 原生應用客戶未上市;Fireworks 客戶;agentic 高 token 用量
[US] Cursor (Anysphere) (—)coding agent 客戶未上市;多平台客戶;coding agent token 用量大

資料來源

常見問答 FAQ

AI 推論服務與優化供應鏈 (AI Inference Serving & Optimization)是什麼?
AI Inference Serving & Optimization — 推論即服務(賣 API/token)與優化軟體層(量化/KV cache/投機解碼,每 GPU 多服務 10–50x 請求)。2026 是推論層自成資產類別的引爆年:Fireworks 洽 $15B(ARR ~$8 億、每日 10+ 兆 token)、Baseten 2026-06-22 完成 $1.5B Series F 估值 $13B(ARR $600M、YoY +1,900%、每日 10 億+ 推論呼叫)、Together 2026-07 完成 $800M Series C 估值躍至 $8.3B(年化 bookings 逾 $11.5 億);Groq 遭 NVIDIA 約 $200 億 …
AI 推論服務供應鏈有哪些關鍵環節?
本主題涵蓋 5 個上下游環節:推論晶片 / 加速器(GPU / LPU / WSE / RDU)、推論引擎 / 優化軟體(賣鏟人核心)、推論即服務平台(IaaS,敘事核心)、聚合 / 路由 / 網關(過路費商業模式)、終端需求(應用 / 企業 / 開源模型方)。
AI 推論服務的龍頭/領先公司有哪些?
關鍵公司包括:NVIDIA(NVDA)、Groq、Cerebras Systems(CBRS)。各環節市佔與競爭態勢詳見供應鏈地圖。
AI 推論服務市場規模與成長性如何?
關鍵數據:服務層底料。各環節完整市場規模與成長率見地圖節點。
AI 推論服務最新發展?
晚 6 月唯一真正新進展:Baseten 於 2026-06-22 正式完成 $1.5B Series F(估值 $13B,由 Altimeter/Conviction/Spark 領投、兩檔 $13B/$11B,18 個月第四輪),原檔僅記為「洽 $11–13B」。已將其由「洽談中」更新為「已完成」,並補上確定數據:ARR $600M、YoY +1,900%(20x)、推論量 +40x、每日 10 億+ 推論呼叫跨 87 叢集/18 雲。其餘熱門事件(Fireworks 洽 $15B、Together 洽 $7.5B、OpenRouter $1.3B、Cerebras IPO、NVIDIA Groq 3 LPX、AMD MI400)均已在檔且仍維持「洽談中」狀態,未重複。(更新日 2026-06-24)

💬 留言討論 (0)

歡迎分享你對此供應鏈/個股的看法。需以 Google 帳號登入後留言;內容僅供研究討論,非投資建議。