繁中 ▾
取得 API 金鑰

LLM API 定價:你必須了解的迷思與事實

LLM API 定價通常以簡單的每 token 費率掩蓋複雜性,但了解輸入/輸出拆分、上下文視窗成本與串流額外開銷對於預算準確性至關重要。本指南將拆解運行語言模型的真實成本,比較主要供應商的結構,並展示無審查、開放權重 API 如何提供透明、可預測的定價且無隱藏分級。

更新

重點摘要

  1. 輸入與輸出 token 的定價很少相同;輸出通常比輸入貴 2–4 倍。
  2. 上下文視窗限制會影響成本效益;較長的上下文需要更多記憶體和更高的基礎費率。
  3. 串流增加的計算額外開銷可忽略不計,但如果客戶端處理不當,可能會使計費變得複雜。
  4. 開放權重模型通常比經常調整費率的專有供應商提供更可預測的定價。

輸入/輸出價格差距

評估LLM API 定價時,最重要的變數是輸入與輸出的成本比率。大多數供應商處理您的提示詞的費用低於生成回應的費用。這並非隨機;生成 token 所需的運算週期多於編碼它們。例如,API 可能對每百萬個輸入 token 收取 $0.25,但對每百萬個輸出 token 收取 $1.00。這種 4:1 的比率意味著您的預算在很大程度上取決於模型回覆的長度。

開發人員經常低估這種差距。如果您發送 1,000 個 token 的提示詞並收到 500 個 token 的回應,您的輸入成本可以忽略不計,但輸出成本佔主導地位。相反地,如果您發送 10,000 個 token 並收到 1,000 個 token 的摘要任務,情況就會反轉。請先計算您預期的輸出量。如果您的用例會產生長回應,請優先選擇輸出費率較低的 API。

某些模型提供固定費率,但在高效能層級中很少見。趨勢是朝向非對稱定價以反映實際計算負載。比較供應商時,請始終查看每百萬 token 的輸出價格,而不只是平均價格。這個單一指標決定你的應用程式是具成本效益地擴展還是快速耗盡預付額度。

上下文視窗成本

上下文視窗定義模型在單一請求中能處理多少文字。雖然許多 API 提供 8k 或 32k 視窗,但較新的模型支援 100k 甚至 128k token。較大的上下文視窗會增加成本嗎?通常會。供應商可能會對超過特定閾值的 token 收取更高的費率,或者為了支援記憶體額外開銷而提高所有 token 的價格。

例如,提供 100k 上下文視窗的 API 可能保持相同的每 token 價格,但每個請求需要更多的 GPU 記憶體。這種效率提升允許你傳遞整個文件或長對話歷史而無需截斷。然而,你必須確保應用程式能高效處理大型負載。如果 API 按 token 而非按請求計費,單一包含 60k token 的請求可能比十個包含 6k token 的請求更昂貴。

考慮你的資料結構。如果你正在建構聊天機器人,上下文會隨著每次對話輪次增長。在 100k 限制下,你可以保留更多歷史記錄,減少需要額外 token 和成本的複雜摘要步驟。但如果你的平均對話只有 2k token,100k 視窗不會提供定價優勢。將上下文長度匹配到你的實際使用模式,以避免為未使用的容量付費。

串流與非串流定價

串流在生成時將 token 發送給客戶端,改善感知的延遲。串流會改變價格嗎?在大多數情況下不會。無論你是串流輸出還是等待完整回應,計算成本都是相同的。然而,如果你的客戶端程式庫以不同方式計算 token,串流可能會影響你的計費方式。

一些舊的計費系統按連線或資料片計費,這會使串流的成本膨脹。現代 API 嚴格按 token 計費,無論交付方式為何。這意味著你可以串流回應而無需擔心隱藏費用。唯一的成本差異可能在網路頻寬,但對於文字來說通常可忽略不計。

一個技術上的權衡:串流需要你的客戶端處理部分回應和潛在的中斷。如果串流中途失敗,你可能已經收到了 50% 的 token。確保你的計費邏輯只計算成功生成並交付的 token。這可以防止從未到達使用者的 token 產生「幽靈」費用。請務必確認你選擇的 API 供應商是在生成時而非交付時計算 token,以確保公平性。

隱藏費用說明

除了每 token 費率外,還有幾項隱藏費用可能會讓開發者驚訝。首先,檢查是否有最低請求費用。某些 API 每次呼叫收取最低金額,即使 token 數量很低。這會懲罰高頻率、低容量的使用。其次,查看速率限制超額費用。如果你超過每分鐘請求數,你會被收取雙倍費用,還是請求被直接丟棄?被丟棄的請求可能仍會被計費,也可能不會,這取決於供應商的策略。

另一個隱藏成本是工具使用的「額外 token 消耗」。當模型呼叫函式時,它會生成額外的 token 來描述工具及其參數。這些 token 會計入您的總使用量。如果您經常使用工具,這可能會顯著增加您的帳單。請確保您的 API 金鑰和帳單儀表板盡可能單獨追蹤工具使用的 token。

最後,考慮重試的成本。如果請求因超時失敗,你會再次付費嗎?大多數供應商會。如果你的應用程式在臨時錯誤時積極重試,你的成本可能會倍增。實施指數退避並限制重試次數,以避免意外帳單。請務必閱讀服務條款,以了解 token 何時被視為「已計費」。

與 GPT 和 Claude 的比較

當將 llm api pricing 與 GPT 和 Claude 等主要供應商比較時,請記住他們的定價結構複雜且經常更新。例如,GPT-4o 對輸入和輸出有不同的費率,並為高頻率使用提供額外分級。Claude 提供類似的非對稱定價,但比率通常不同。這些供應商也經常推出具有新價格點的新模型。

關鍵差異在於透明度。主要供應商通常會捆綁功能或提供需要談判或特定分級升級的批量折扣。相比之下,許多較小、無審查的 API 提供直接的隨用隨付定價。例如,無審查 API 可能收取每百萬輸入 token $0.25 和每百萬輸出 token $1.00,且無隱藏分級。這種簡單性對於想要準確預測成本的開發者來說是一個顯著的優勢。

另一個因素是模型獨佔性。像 OpenAI 和 Anthropic 這樣的供應商只提供他們自己的模型。無審查 API 可能提供單一、針對特定用途高度優化的模型。這可以導致針對利基任務有更好的效能,但靈活性較低。如果你需要在不同任務之間切換模型,供應商生態系統可能更好。如果你需要針對單一任務保持一致、低成本的效能,單一模型 API 通常更便宜。

批量折扣與贈金

大多數 API 供應商提供批量折扣,但結構各不相同。有些提供分級定價:使用越多,每 token 費率越低。另一些提供預付額度贈金。例如,向你的帳戶添加 $100 可能會給你 $110 的額度。這相當於 10% 的折扣。對於高容量用戶,這可以節省大量資金。

將其與企業合約相比,後者的折扣是每年談判的。預付贈金通常更適合小團隊或個人開發者。它們不需要承諾,可以立即使用。然而,請檢查過期日期。某些預付額度在一年後過期,而其他則無限期有效。

此外,考慮機會成本。如果你預付 $1,000,你就鎖定了這些資金。如果 API 下個月漲價,你已經以舊費率付費。這是一個好處,但僅在價格上漲顯著時才成立。對於大多數中小型用戶,預付贈金提供了節省與靈活性之間的最佳平衡。請務必在贈金後計算有效的每 token 費率以進行準確比較。

Token 估算指南

準確估算 token 使用量對於預算至關重要。一個常見的經驗法則是 1,000 個 token 大約等於 750 個英文單字。然而,這會因語言和複雜度而異。特殊字元、程式碼和 JSON 結構可能有不同的 token 計數。請務必使用你的特定資料類型進行測試。

在發送請求之前,使用 API 的 tokenizer 計算提示詞中的 token 數量。這使您可以精確預測成本。例如,如果您的提示詞為 500 個 token,且預期回應為 200 個 token,您可以計算確切的成本。將輸入 token 乘以輸入費率,並將輸出 token 乘以輸出費率。

別忘了計算函式呼叫和系統提示詞。這些會增加用戶常忽略的 token。簡單的系統提示詞如「你是一個有幫助的助手」可能是 10 個 token,但如果每次請求都發送,它們會累積起來。根據預期的請求量和平均回應長度估算你每月的總 token 使用量。這可以防止在帳單週期結束時出現意外。

開放權重對成本的影響

開放權重模型允許開發者了解底層架構,這會影響成本效益。雖然 API 供應商託管模型,但知道它是開放權重意味著定價通常更貼近實際計算成本,而非專有利潤。專有模型可能包含品牌或獨特功能的溢價。

此外,開放權重模型有時可以自行託管。如果你的使用量超過 API 可負擔的範圍,你可以下載權重並在自己的 GPU 上運行。如果 API 價格上漲,這提供了一個明確的退出路徑。對於 API 來說,這種透明度建立了信任。用戶知道他們沒有為「黑盒子」溢價付費。

然而,自行託管需要基礎設施專業知識。對於大多數開發人員來說,API 路線更具成本效益,因為具有規模經濟效應。關鍵在於開放權重性質確保 API 定價具有競爭力且透明。您可以驗證模型的效能與限制,確保其符合您的需求且沒有隱藏的約束。這種透明度是LLM API 定價領域中的一大優勢。

問答

串流輸出會改變 LLM API 請求的成本嗎?

不會,串流輸出不會改變每個 token 的成本。無論 token 是即時發送還是一次性發送,計算負載都是相同的。不過,請確保你的計費系統只計算成功交付的 token,以避免為丟失的串流付費。

我該如何估算 API 請求的 token 數量?

使用 API 供應商的 tokenizer 計算提示詞和預期回應中的 token 數量。粗略估計為每 750 個字約 1,000 個 token,但這會因語言和格式而異。請始終使用您的特定資料類型進行測試以確保準確性。

LLM API 定價中是否有隱藏費用?

有,常見的隱藏費用包括最低請求費用、突破速率限制時的超額費率,以及函式呼叫或系統訊息的 token 計數。請務必閱讀服務條款,以了解 token 何時會被計費。

為什麼選擇無審查 API 而不是 GPT 或 Claude?

無審查 API 通常提供更簡單、更透明的定價,並提供預付獎勵且沒有隱藏層級。它們還提供可訪問不拒絕爭議性話題的模型,這對創意寫作或研究等特定用例至關重要。

只差一張表單,即可取得金鑰

建立帳戶,複製金鑰,更改 Base URL。這就是整個設定過程。

取得 API 金鑰