NVIDIA免费API
NVIDIA 提供了免费的 NIM (NVIDIA Inference Microservices) API ,允许开发者通过 build.nvidia.com 免费访问 80+(甚至 100+)个领先 AI 模型,包括 DeepSeek、GLM、Kimi、Qwen、Llama、Nemotron 等,支持 OpenAI 兼容接口,无需信用卡,主要用于原型开发、测试和个人/研究用途。
如何获取和使用免费 NVIDIA API
- 注册/登录 :
- 访问 https://build.nvidia.com/ 或 https://build.nvidia.com/explore/discover 。
- 使用免费的 NVIDIA Developer Program 账号登录(或注册)。
- 访问 https://build.nvidia.com/ 或 https://build.nvidia.com/explore/discover 。
- 生成 API Key :
- 登录后,在右上角头像 → API Keys → Generate API Key。
- Key 格式通常为 nvapi-…,仅显示一次,妥善保存。
- 部分模型页面点击 “Get API Key” 即可。
- 登录后,在右上角头像 → API Keys → Generate API Key。
- 调用方式 (OpenAI 兼容):
from openai import OpenAI
client = OpenAI(
base_url="https://integrate.api.nvidia.com/v1",
api_key="你的_nvapi_key"
)
response = client.chat.completions.create(
model="deepseek-ai/deepseek-v4" # 或其他模型 ID,在 catalog 中查看
messages=[{"role": "user", "content": "Hello!"}],
temperature=0.7
)
print(response.choices[0].message.content)- 支持大多数支持 OpenAI 格式的工具(如 LangChain、LlamaIndex、SillyTavern、Cursor、Claude Code 等)。
免费额度与限制(2026 年现状)
- 免费模型 :许多模型(如 GLM-5.1、MiniMax、DeepSeek 等)完全免费推理,无需消耗 credits。
- Rate Limit :通常约 40 requests per minute (RPM) ,模型和流量相关(非固定 SLA)。高峰期可能更严格。
- Credits :早期有 1000-5000 credits 机制,现在主要转为 rate-limit 为主。个人账号可通过 dashboard “Request More” 申请增加。
- 使用场景 :适合原型、测试、个人开发。生产环境建议自托管 NIM 或购买 NVIDIA AI Enterprise。
限流处理建议 :
- 等待片刻重试(429 错误后)。
- 切换不同模型测试速度。
- 论坛请求提高限流(提供用途,如个人开发),部分用户成功从 40 RPM 提高,但非保证。
可用模型示例
平台有大量模型,包括:
- 编码/推理 :DeepSeek V4、Qwen3、GLM-5.1、Kimi K2.5、Nemotron 等。
- 多模态 :支持图像/视频的模型。
- 在 catalog 中搜索并查看具体 model ID、上下文长度、性能指标。
优势与注意事项
优势 :
- 模型丰富 :一次性访问多家顶级模型(国产 + 国际)。
- 性能好 :NVIDIA DGX Cloud 托管,推理速度快。
- 兼容性高 :OpenAI SDK 一行切换。
- 完全免费 :无时间限制(用于开发/测试),无需 GPU。
注意/限制 :
- 主要为 开发/原型 ,非生产级 SLA。
- 限流存在,适合个人/轻度使用,重度依赖建议自托管 NIM(下载容器在本地或云 GPU 运行)。
- 部分高级功能或企业模型可能需 NVIDIA AI Enterprise 许可。
- 遵守 NVIDIA 服务条款,避免滥用。
其他 NVIDIA 免费资源
- NGC (NVIDIA GPU Cloud) :下载容器、模型,需 API Key(不同用途)。
- 自托管 NIM :免费下载微服务,在自己的 GPU 上运行,无 API 调用限制。
- 文档 :查看 developer.nvidia.com/nim 和官方 FAQ。
推荐起步 :立即去 build.nvidia.com 试用几个热门模型,体验速度和效果。如果你遇到具体问题(如某个模型 ID、集成代码、限流),可以提供更多细节,我可以进一步帮忙调试或推荐替代方案。享受免费的强大 AI 能力!
剛剛申請了NVIDIA api key, 怎樣放入LiteLLM?
✅ 把 NVIDIA API Key 放入 LiteLLM 的完整指南 (2026 年最新方式)
LiteLLM 對 NVIDIA NIM 支援非常好,直接用 nvidia_nim/ 前綴即可路由到 https://integrate.api.nvidia.com/v1。
1. 最簡單方式:設定環境變數(推薦個人使用)
# Linux / macOS
export NVIDIA_NIM_API_KEY="nvapi-你的完整key這裡"
# Windows PowerShell
$env:NVIDIA_NIM_API_KEY = "nvapi-你的完整key這裡"或在 Python 程式碼開頭設定:
import os
os.environ['NVIDIA_NIM_API_KEY'] = "nvapi-你的完整key這裡"測試呼叫 :
from litellm import completion
import os
# 如果還沒設定環境變數,就在這裡設定
# os.environ['NVIDIA_NIM_API_KEY'] = "nvapi-..."
response = completion(
model="nvidia_nim/deepseek-ai/deepseek-v4", # 替換成你想用的模型
messages=[{"role": "user", "content": "你好,請自我介紹"}],
temperature=0.7
)
print(response.choices[0].message.content)常見模型前綴範例 (去 build.nvidia.com 看完整 model ID):
- nvidia_nim/deepseek-ai/deepseek-v4
- nvidia_nim/qwen/qwen3-235b-a22b
- nvidia_nim/z-ai/glm5
- nvidia_nim/moonshotai/kimi-k2.5
- nvidia_nim/meta/llama3-70b-instruct 等
2. 使用 LiteLLM Proxy Server(強烈推薦用在 Claude Code、SillyTavern、Cursor 等工具)
建立一個 config.yaml:
model_list:
- model_name: deepseek-v4 # 你自訂的名稱,之後在其他工具使用這個
litellm_params:
model: nvidia_nim/deepseek-ai/deepseek-v4 # 必須加 nvidia_nim/ 前綴
api_key: os.environ/NVIDIA_NIM_API_KEY # 推薦這樣寫,安全
# api_base: https://integrate.api.nvidia.com/v1 # 可選,預設就是這個
- model_name: qwen3-235b
litellm_params:
model: nvidia_nim/qwen/qwen3-235b-a22b
api_key: os.environ/NVIDIA_NIM_API_KEY
litellm_settings:
drop_params: true # 很重要!避免 Anthropic 特有參數出錯
general_settings:
master_key: "sk-123456" # 自訂 proxy 的 master key啟動 Proxy:
litellm --config config.yaml之後其他工具就把 base_url 設為 http://0.0.0.0:4000 或 http://localhost:4000,api\_key 填 sk-123456 即可。
Docker 啟動方式 (方便持久化):
docker run -d \
-p 4000:4000 \
-e NVIDIA_NIM_API_KEY="nvapi-你的key" \
-v $(pwd)/config.yaml:/app/config.yaml \
--name litellm-nim \
docker.litellm.ai/berriai/litellm:main-stable \
--config /app/config.yaml注意事項與常見問題
- API Key 安全 :不要直接寫死在程式碼或 config.yaml 裡,優先用 os.environ/NVIDIA_NIM_API_KEY 或.env 檔。
- Rate Limit :免費帳號大約 40 RPM,高峰期可能更嚴。遇到 429 就等一下或申請提高限流。
- drop_params: true :如果用在 Claude Code 或其他非 OpenAI 格式的工具,一定要加,否則容易出錯。
- 查可用模型 :可以用 curl 查詢:
curl https://integrate.api.nvidia.com/v1/models \ -H "Authorization: Bearer nvapi-你的key" - 自訂 base_url :如果想改,可以在 litellm_params 裡加 api_base。
想現在就測試嗎? 把你的 NVIDIA key 設定好後,直接跑上面第一段 Python 程式碼試試看。
有遇到任何錯誤(例如模型 ID 找不到、429、認証失敗等),把錯誤訊息貼給我,我幫你 debug! 也可以告訴我你主要想用在哪個工具(Claude Code、SillyTavern、LangChain、Cursor…),我給更針對性的設定。
我在Oracle cloud vps 用docker 安裝litellm,我現在在 Litellm v.1.91.0 介面,怎樣設定NVIDIA key
✅ 在 Oracle Cloud VPS Docker + LiteLLM v1.91.0 設定 NVIDIA API Key 的完整步驟
你目前在 LiteLLM UI 介面,推薦 兩種主要方式 :
- Docker 環境變數 + config.yaml (最穩定,推薦)
- 直接在 LiteLLM UI 透過 LLM Credentials 設定 (較方便,但仍建議搭配 config)
方式 1:Docker 環境變數 + config.yaml(推薦生產使用)
步驟 1:建立或編輯 config.yaml
在你的 VPS 上,進入 LiteLLM config 目錄(通常是你 -v 掛載的資料夾,例如 /root/litellm/):
cd /你的/config/路徑 # 例如 cd ~/litellm
nano config.yaml加入以下內容(可多次新增不同模型):
model_list:
- model_name: deepseek-v4 # 你自訂的名稱,之後在 UI 或其他工具使用
litellm_params:
model: nvidia_nim/deepseek-ai/deepseek-v4 # 必須加 nvidia_nim/ 前綴
api_key: os.environ/NVIDIA_NIM_API_KEY # 推薦這樣寫(安全)
# api_base: https://integrate.api.nvidia.com/v1 # 可選,預設就是這個
- model_name: qwen3-235b
litellm_params:
model: nvidia_nim/qwen/qwen3-235b-a22b
api_key: os.environ/NVIDIA_NIM_API_KEY
litellm_settings:
drop_params: true # 很重要!避免其他工具傳參數出錯
general_settings:
master_key: "sk-你的自訂masterkey" # 必須以 sk- 開頭步驟 2:重啟 Docker 容器並注入 Key
停止舊容器後重新運行(替換成你的實際命令):
# 先停止舊容器
docker stop litellm # 或你的容器名稱
# 重新運行(重點是 -e NVIDIA_NIM_API_KEY)
docker run -d \
-p 4000:4000 \
-e NVIDIA_NIM_API_KEY="nvapi-你的完整key" \
-v /你的本地/config.yaml:/app/config.yaml \
--name litellm \
--restart always \
docker.litellm.ai/berriai/litellm:main-stable \
--config /app/config.yaml提示 :
- 使用 main-stable 或 main-latest 確保版本接近 v1.91.0。
- 如果你用 docker compose,就把 NVIDIA_NIM_API_KEY 放在.env 檔裡,再用 ${NVIDIA_NIM_API_KEY} 引用。
方式 2:直接在 LiteLLM UI 設定(快速測試)
- 進入 LiteLLM UI(通常是 http://你的VPS\_IP:4000/ui)
- 用 master key 登入(admin 權限)
- 前往 Models → LLM Credentials → Add Credential
- 選擇 Provider: NVIDIA NIM
- 貼上你的 NVIDIA API Key (nvapi-…)
- 儲存
- 再去 Models → Add Model
- Model Name:自訂(如 deepseek-v4)
- LiteLLM Model:nvidia_nim/deepseek-ai/deepseek-v4
- 選擇剛剛建立的 Credential
- 儲存
- Model Name:自訂(如 deepseek-v4)
這樣 UI 就會直接使用這個 credential。
驗證是否成功
在 VPS 上測試:
curl -X POST http://localhost:4000/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer sk-你的masterkey" \
-d '{
"model": "deepseek-v4",
"messages": [{"role": "user", "content": "你好,測試 NVIDIA"}]
}'或在 LiteLLM UI 的 Playground 直接選擇模型測試。
常見問題與注意事項(Oracle Cloud VPS)
- 429 Rate Limit :免費 NVIDIA 約 40 RPM,遇到就等一下或申請提高。
- 容器重啟後 Key 不見 :一定要用 -e NVIDIA_NIM_API_KEY 或.env 檔,不要只寫死在 config.yaml。
- drop_params: true :如果你要接 Claude Code、SillyTavern、Cursor 等工具,務必加上。
- 防火牆 :Oracle Cloud 記得在 Security List 開放 4000 端口。
- 持久化 :強烈建議用 docker compose 管理,方便維護.env 和 config.yaml。
- 版本 :v1.91.0 支援 NVIDIA NIM 很好,若有問題可考慮更新到最新 stable。
現在就試試看 :先用方式 1 把 Docker 重新跑起來,然後告訴我測試結果或任何錯誤訊息(例如 401、模型找不到、429 等),我幫你 debug。
你目前是用單純 docker run 還是 docker compose?有沒有把 config.yaml 掛載好?可以貼一下你的 docker run 指令,我幫你修改得更精準。
Failed to add model: ApiError: {‘error’: “Set ‘STORE_MODEL_IN_DB=‘True’ in your env to enable this feature.”}
✅ 解決錯誤:Failed to add model – 需要設定 STORE_MODEL_IN_DB=True
這個錯誤是因為 LiteLLM UI 的「新增模型」功能預設需要把模型資訊存到資料庫(Database),而你目前沒有啟用這個設定。
快速修正步驟(Docker 環境)
1. 修改 Docker 啟動指令(加入環境變數)
停止目前容器,然後用以下指令重新啟動(重點是加上 -e STORE_MODEL_IN_DB=True):
docker stop litellm # 或你的容器名稱
docker run -d \
-p 4000:4000 \
-e NVIDIA_NIM_API_KEY="nvapi-你的完整key" \
-e STORE_MODEL_IN_DB=True \
-e LITELLM_MASTER_KEY="sk-你的masterkey" \ # 確保有這個
-v /你的/config/路徑/config.yaml:/app/config.yaml \
--name litellm \
--restart always \
docker.litellm.ai/berriai/litellm:main-stable \
--config /app/config.yaml2. 如果你使用 docker compose(強烈建議改用)
建立或修改 docker-compose.yml:
version: "3.9"
services:
litellm:
image: docker.litellm.ai/berriai/litellm:main-stable
container_name: litellm
ports:
- "4000:4000"
volumes:
- ./config.yaml:/app/config.yaml
environment:
NVIDIA_NIM_API_KEY: "nvapi-你的完整key"
STORE_MODEL_IN_DB: "True"
LITELLM_MASTER_KEY: "sk-你的masterkey" # 改成你自己的
# 其他設定...
restart: always然後執行:
docker compose down
docker compose up -d更完整的推薦設定(使用資料庫)
只設 STORE_MODEL_IN_DB=True 可能還不夠完整,因為 UI 模型管理功能最好搭配 PostgreSQL 使用(LiteLLM 官方推薦)。
如果你想用完整版,可以快速加一個 Postgres:
docker-compose.yml 範例 (包含 DB):
version: "3.9"
services:
postgres:
image: postgres:16
container_name: litellm-db
environment:
POSTGRES_DB: litellm
POSTGRES_USER: litellm
POSTGRES_PASSWORD: 你的postgres密碼 # 改成強密碼
volumes:
- postgres_data:/var/lib/postgresql/data
restart: always
litellm:
image: docker.litellm.ai/berriai/litellm:main-stable
depends_on:
- postgres
ports:
- "4000:4000"
volumes:
- ./config.yaml:/app/config.yaml
environment:
NVIDIA_NIM_API_KEY: "nvapi-你的完整key"
DATABASE_URL: "postgresql://litellm:你的postgres密碼@postgres:5432/litellm"
STORE_MODEL_IN_DB: "True"
LITELLM_MASTER_KEY: "sk-你的masterkey"
restart: always
volumes:
postgres_data:執行 docker compose up -d 後,LiteLLM 就會自動連資料庫。
設定完成後的操作
- 等待容器啟動(約 10-30 秒)。
- 進入 LiteLLM UI(http://你的VPS\_IP:4000/ui)。
- 用 master key 登入。
- 去 Models → Add Model 再試一次新增 NVIDIA 模型:
- Model Name:deepseek-v4(自訂)
- LiteLLM Model:nvidia_nim/deepseek-ai/deepseek-v4
- 選擇或輸入 NVIDIA Credential(如果之前已加)
- Model Name:deepseek-v4(自訂)
還是有問題?
- 把你現在的 docker run 或 docker-compose.yml 完整內容貼給我(把 key 隱藏)。
- 錯誤訊息如果有更新,也一起貼上。
- 你目前是用單純 docker run 還是 compose?
這樣我可以給你最精準的修改指令。設定好之後就能在 UI 輕鬆管理所有模型了!
version: ‘3.8’ services: litellm: image: ghcr.io/berriai/litellm:main-latest container_name: litellm restart: unless-stopped expose: - “4000” environment: - LITELLM_MASTER_KEY=sk-change-this-to-a-secure-key-via-dockhand - LITELLM_SALT_KEY=sk-random-salt-key-change-this
# [核心修正] 將連線字串的主機名稱改為 litellm-db (連字號),符合 RFC 1123 規範
- DATABASE_URL=postgresql://litellm_user:Admin2026DBpwd@litellm-db:5432/litellm_proxy volumes: - /opt/docker/litellm/config.yaml:/app/config.yaml depends_on: litellm-db: # [核心修正] 依賴名稱同步更新 condition: service_healthy networks: - cf_network litellm-db: # [核心修正] 服務名稱更新為連字號 image: postgres:15-alpine container_name: litellm-db # [核心修正] 容器名稱更新 restart: unless-stopped environment: - POSTGRES_USER=litellm_user - POSTGRES_PASSWORD=Admin2026DBpwd - POSTGRES_DB=litellm_proxy volumes: - /opt/docker/litellm/pg_data:/var/lib/postgresql/data healthcheck: test: [“CMD-SHELL”, “pg_isready -U litellm_user -d litellm_proxy”] interval: 5s timeout: 5s retries: 5 networks: - cf_network networks: cf_network: external: true
✅ 你的 docker-compose.yml 需要補上關鍵環境變數
你的設定整體已經不錯(有 Postgres),但缺少 NVIDIA Key 和 STORE_MODEL_IN_DB=True ,導致無法在 UI 新增模型。
修改後的完整 docker-compose.yml(直接替換使用)
version: '3.8'
services:
litellm:
image: ghcr.io/berriai/litellm:main-latest
container_name: litellm
restart: unless-stopped
ports: # 改用 ports 而非 expose,方便外部訪問
- "4000:4000"
environment:
- LITELLM_MASTER_KEY=sk-change-this-to-a-secure-key-via-dockhand
- LITELLM_SALT_KEY=sk-random-salt-key-change-this
- STORE_MODEL_IN_DB=True # ← 解決你目前錯誤的關鍵
- NVIDIA_NIM_API_KEY=nvapi-你的完整key這裡 # ← 填你的 NVIDIA Key
- DATABASE_URL=postgresql://litellm_user:Admin2026DBpwd@litellm-db:5432/litellm_proxy
volumes:
- /opt/docker/litellm/config.yaml:/app/config.yaml
depends_on:
litellm-db:
condition: service_healthy
networks:
- cf_network
litellm-db:
image: postgres:15-alpine
container_name: litellm-db
restart: unless-stopped
environment:
- POSTGRES_USER=litellm_user
- POSTGRES_PASSWORD=Admin2026DBpwd
- POSTGRES_DB=litellm_proxy
volumes:
- /opt/docker/litellm/pg_data:/var/lib/postgresql/data
healthcheck:
test: ["CMD-SHELL", "pg_isready -U litellm_user -d litellm_proxy"]
interval: 5s
timeout: 5s
retries: 5
networks:
- cf_network
networks:
cf_network:
external: true修改重點說明
- 新增 STORE_MODEL_IN_DB=True → 解決你遇到的 Set ‘STORE_MODEL_IN_DB=True’ 錯誤。
- 新增 NVIDIA_NIM_API_KEY → 讓 LiteLLM 能使用你的 NVIDIA Key。
- 把 expose 改成 ports → 確保外部(包括 Cloudflare)能訪問 4000 端口。
- 其他保持不變(包含你修正過的連字號命名)。
操作步驟
- 把上面的內容複製覆蓋你的 docker-compose.yml。
- 把 nvapi-你的完整key這裡 替換成真實的 NVIDIA API Key。
- 執行以下指令更新:
cd /opt/docker/litellm/ # 進入你的 compose 目錄
docker compose down
docker compose up -d- 等待 20~30 秒讓 Postgres 和 LiteLLM 啟動。
- 進入 LiteLLM UI:
- 網址:http://你的VPS\_IP:4000/ui
- 用 LITELLM_MASTER_KEY 登入
- 網址:http://你的VPS\_IP:4000/ui
推薦 config.yaml 內容(同步確認)
確認 /opt/docker/litellm/config.yaml 至少要有以下基本內容:
model_list:
- model_name: deepseek-v4
litellm_params:
model: nvidia_nim/deepseek-ai/deepseek-v4
api_key: os.environ/NVIDIA_NIM_API_KEY
litellm_settings:
drop_params: true
general_settings:
master_key: sk-change-this-to-a-secure-key-via-dockhand完成後測試 :
- 在 UI 的 Playground 或 Models 頁面新增模型測試。
- 或用 curl 測試:
curl -X POST http://localhost:4000/v1/chat/completions \
-H "Authorization: Bearer sk-change-this-to-a-secure-key-via-dockhand" \
-H "Content-Type: application/json" \
-d '{"model": "deepseek-v4", "messages": [{"role": "user", "content": "測試 NVIDIA 是否正常"}]}'還有問題請直接回覆 :
- 執行 docker compose up -d 後的 log(如果有錯誤)。
- UI 是否還出現相同錯誤。
- 或目前 docker compose logs 的輸出。
我會繼續幫你 debug,直到完全成功!
cloudflare worker AI key, 怎樣放入LiteLLM?
✅ 把 Cloudflare Workers AI Key 加入 LiteLLM(Docker + config.yaml 方式)
Cloudflare Workers AI 在 LiteLLM 中的支援很好,主要需要兩個資訊:
- CLOUDFLARE_API_KEY (Cloudflare API Token)
- CLOUDFLARE_ACCOUNT_ID (你的 Cloudflare 帳戶 ID)
步驟 1:取得 Cloudflare 必要資訊
- Cloudflare Account ID :
- 登入 Cloudflare Dashboard
- 點選任意一個 Domain → 右側會看到 Account ID (一串英數字)
- 登入 Cloudflare Dashboard
- Cloudflare API Token :
- 前往 https://dash.cloudflare.com/profile/api-tokens
- 建立 Token → 選擇 Create Custom Token
- 權限至少包含:
- Account → Workers AI → Read + Edit - Account → AI Gateway → Read(可選)
- 建立後複製 Token(格式通常是 xxxxxxxxxxxx)
- 前往 https://dash.cloudflare.com/profile/api-tokens
步驟 2:修改 docker-compose.yml(推薦加入環境變數)
在你的 /opt/docker/litellm/docker-compose.yml 中, litellm service 的 environment 區塊加入以下兩行:
environment:
- LITELLM_MASTER_KEY=sk-change-this-to-a-secure-key-via-dockhand
- LITELLM_SALT_KEY=sk-random-salt-key-change-this
- STORE_MODEL_IN_DB=True
- NVIDIA_NIM_API_KEY=nvapi-你的NVIDIAkey
- CLOUDFLARE_API_KEY=你的Cloudflare_API_Token # ← 新增
- CLOUDFLARE_ACCOUNT_ID=你的Cloudflare_Account_ID # ← 新增
- DATABASE_URL=postgresql://litellm_user:Admin2026DBpwd@litellm-db:5432/litellm_proxy修改完後執行:
cd /opt/docker/litellm
docker compose down
docker compose up -d步驟 3:修改 config.yaml(加入 Cloudflare 模型)
編輯 /opt/docker/litellm/config.yaml,在 model_list 加入以下內容(可一次加多個模型):
model_list:
# ... 你原本的 NVIDIA 模型 ...
# Cloudflare Workers AI 模型範例
- model_name: llama-3-8b-instruct-cf # 自訂名稱,之後在 UI 或工具中使用
litellm_params:
model: cloudflare/@cf/meta/llama-3-8b-instruct
api_key: os.environ/CLOUDFLARE_API_KEY
# api_base 可省略,LiteLLM 會自動處理
- model_name: mistral-7b-cf
litellm_params:
model: cloudflare/@cf/mistral/mistral-7b-instruct-v0.1
api_key: os.environ/CLOUDFLARE_API_KEY
- model_name: gemma-2-9b-cf
litellm_params:
model: cloudflare/@cf/google/gemma-2-9b-it
api_key: os.environ/CLOUDFLARE_API_KEY
# 更多模型可參考:https://developers.cloudflare.com/workers-ai/models/推薦設定 (放在最上方):
litellm_settings:
drop_params: true
modify_params: true # 對 Cloudflare 很有幫助重啟後生效。
步驟 4:驗證是否成功
- 等容器啟動完(docker compose logs -f litellm 查看 log)。
- 在 LiteLLM UI(http://你的VPS\_IP:4000/ui)的 Playground 選擇 llama-3-8b-instruct-cf 測試。
- 或用 curl 測試:
curl -X POST http://localhost:4000/v1/chat/completions \
-H "Authorization: Bearer sk-change-this-to-a-secure-key-via-dockhand" \
-H "Content-Type: application/json" \
-d '{
"model": "llama-3-8b-instruct-cf",
"messages": [{"role": "user", "content": "你好,這是 Cloudflare Workers AI 測試"}]
}'注意事項(Cloudflare Workers AI)
- 免費額度 :每天有一定免費額度(視模型而定),超過後按使用量收費。
- 速度 :邊緣運算,延遲低,但大模型推理較慢。
- 模型 ID :必須是 cloudflare/@cf/xxx 格式,完整清單看官方文件。
- Rate Limit :LiteLLM 會幫你處理部分,但 Cloudflare 本身有限制。
- UI 新增模型 :因為你已開 STORE_MODEL_IN_DB=True,也可以直接在 UI 的 Models → Add Model 手動新增(LiteLLM Model 填 cloudflare/@cf/meta/llama-3-8b-instruct)。
現在就試試 :把上面設定加上去,重啟容器後告訴我測試結果或任何錯誤訊息(例如 401、模型不存在、429 等),我會立刻幫你調整。
你目前想優先加哪幾個 Cloudflare 模型?(例如 Llama 3、Mistral、Gemma 等)我可以給你更精準的 config 片段。
LiteLLM api key, 怎樣取得?
✅ LiteLLM API Key(Master Key)取得與使用完整說明
在你目前的 Docker 設定中, LiteLLM API Key 就是你 docker-compose.yml 裡設定的 LITELLM_MASTER_KEY 。
1. 查看你目前的 LiteLLM Master Key
打開你的 docker-compose.yml:
cd /opt/docker/litellm
cat docker-compose.yml | grep LITELLM_MASTER_KEY你應該會看到這一行:
- LITELLM_MASTER_KEY=sk-change-this-to-a-secure-key-via-dockhand這個就是你的 LiteLLM API Key (預設是 sk-change-this-to-a-secure-key-via-dockhand)。
2. 強烈建議立即修改成安全的 Key
# 產生一個安全的隨機 Key(推薦)
openssl rand -hex 32
# 或用下面這行更像 OpenAI 格式
echo "sk-$(openssl rand -hex 24)"然後修改 docker-compose.yml:
environment:
- LITELLM_MASTER_KEY=sk-你自己產生的一串很長很安全的字串 # ← 改這裡
- LITELLM_SALT_KEY=sk-另一個隨機的salt-key修改完後重啟:
docker compose down
docker compose up -d3. 如何使用這個 LiteLLM API Key
所有工具(Cursor、Claude Code、SillyTavern、OpenAI SDK、LangChain 等)都這樣使用:
- Base URL :http://你的VPS\_IP:4000 或 http://你的域名:4000
- API Key :就是上面的 LITELLM_MASTER_KEY(以 sk- 開頭)
Python 測試範例 :
from openai import OpenAI
client = OpenAI(
base_url="http://你的VPS_IP:4000/v1",
api_key="sk-你設定的master-key"
)
response = client.chat.completions.create(
model="deepseek-v4", # 或你設定的任何模型名稱
messages=[{"role": "user", "content": "測試 LiteLLM 是否正常"}]
)
print(response.choices[0].message.content)4. 進階:建立多個 Virtual Key(建議做法)
LiteLLM 支援建立多個子 Key(Virtual Keys),方便管理不同工具或使用者。
方法有兩種:
方法 A:在 LiteLLM UI 操作(最方便)
- 進入 http://你的VPS\_IP:4000/ui
- 用 Master Key 登入
- 左側選單 → Keys → + Create Key
- 設定名稱、預算、到期時間等 → 建立
- 複製產生的 Key(也是 sk- 開頭)
方法 B:用 API 建立
curl -X POST http://localhost:4000/key/generate \
-H "Authorization: Bearer sk-你的master-key" \
-H "Content-Type: application/json" \
-d '{
"key_alias": "cursor-key",
"max_budget": 10
}'5. 常見問題
- 忘記 Master Key → 直接修改 docker-compose.yml 後重啟即可。
- Key 無效(401 錯誤) → 確認 Key 前後沒有空格,且以 sk- 開頭。
- 想改 Key 不影響現有設定 → 改完 master key 後,所有舊的 virtual key 可能需要重新產生。
- 安全性 :Master Key 權限最高,建議只用在伺服器內部或極少數信任工具,平常使用 Virtual Key 即可。
現在請告訴我 :
- 你目前 LITELLM_MASTER_KEY 的值是什麼?(可以打馬賽克中間部分)
- 你主要想把 LiteLLM 接在哪個工具上?(Cursor、Claude Code、SillyTavern、VS Code、其他?)
我可以給你對應工具最精準的設定方式。需要我幫你產生安全的 Key 也可以直接說!
Virtual Keys 可以用在浸沉或翻譯嗎?怎樣設定?
✅ 是的!LiteLLM 的 Virtual Keys 非常適合用在「浸沉翻譯」(Immersion Translation / Roleplay Translation)場景。
Virtual Keys 可以讓你為不同用途建立獨立的 API Key,方便控制預算、速率限制、特定模型,並且安全地用在 SillyTavern、RisuAI、Agnai、SillyTavern Extras、翻譯腳本等浸沉翻譯工具上。
1. Virtual Keys 的優點(浸沉翻譯場景)
- 每個 Key 可以綁定特定模型(例如只允許 DeepSeek 或 Cloudflare 的翻譯模型)
- 可以設定預算上限(避免意外高額消耗)
- 可以設定 RPM / TPM 限制(防止翻譯時被 rate limit 卡住)
- 可以設定到期時間
- 不同工具用不同 Key,方便追蹤和管理
2. 如何建立 Virtual Key(兩種方式)
方式 A:在 LiteLLM UI 建立(最推薦)
- 進入 LiteLLM UI:http://你的VPS\_IP:4000/ui
- 用 Master Key 登入
- 左側選單點 Keys → + Create Key
- 填寫以下設定(針對浸沉翻譯推薦):
- Key Name / Alias :例如 immersion-translation 或 sillytavern-key
- Models :可以限制只能使用特定模型,例如:
- deepseek-v4 - qwen3-235b - llama-3-8b-instruct-cf(Cloudflare)
- Max Budget :例如 5(美元)或更高
- TPM / RPM Limit :TPM 設高一點(如 1000000),RPM 設 60~120(翻譯時比較順)
- Duration :可設 30 天或永不過期
- Metadata :可加註記 {“purpose”: “immersion-translation”}
- Key Name / Alias :例如 immersion-translation 或 sillytavern-key
- 建立後 立即複製 產生的 Key(格式仍是 sk-…)
方式 B:用 curl 建立
curl -X POST http://localhost:4000/key/generate \
-H "Authorization: Bearer sk-你的Master-Key" \
-H "Content-Type: application/json" \
-d '{
"key_alias": "immersion-key",
"models": ["deepseek-v4", "qwen3-235b"],
"max_budget": 10,
"tpm_limit": 2000000,
"rpm_limit": 120,
"duration": "30d"
}'3. 在浸沉翻譯工具中使用 Virtual Key
以 SillyTavern 為例(最常見) :
- 打開 SillyTavern
- 設定 → API → 選擇 OpenAI
- API URL 填:http://你的VPS\_IP:4000/v1
- API Key 填:剛剛建立的 Virtual Key
- Model 填:你在 LiteLLM 設的自訂名稱,例如 deepseek-v4 或 immersion-model
- 推薦額外設定:
- Temperature:0.7~1.0(浸沉感較好)
- Max Tokens:800~2000(視模型)
- 開啟 Streaming (更即時)
- Temperature:0.7~1.0(浸沉感較好)
翻譯專用設定(常見做法) :
很多浸沉玩家會建立 兩個 Key :
- main-chat-key:用大模型(DeepSeek / Qwen)負責角色扮演
- translation-key:用較快/便宜模型(Cloudflare Llama-3-8B 或 Gemma)專門翻譯
你也可以在 LiteLLM config.yaml 設定 fallback 或 router 來自動處理翻譯。
4. 推薦 config.yaml 加強浸沉體驗
在 /opt/docker/litellm/config.yaml 可以加上:
model_list:
- model_name: immersion-main
litellm_params:
model: nvidia_nim/deepseek-ai/deepseek-v4
api_key: os.environ/NVIDIA_NIM_API_KEY
- model_name: immersion-translate
litellm_params:
model: cloudflare/@cf/meta/llama-3-8b-instruct
api_key: os.environ/CLOUDFLARE_API_KEY
litellm_settings:
drop_params: true
modify_params: true
fallbacks:
- "immersion-main": ["immersion-translate"] # 主模型失敗時自動切換重啟 LiteLLM 後生效。
現在就試試看 :
- 先在 UI 建立一個 immersion-key
- 複製 Key 後,馬上去 SillyTavern 或你的翻譯工具測試
- 測試成功後告訴我:
- 你主要用哪個前端工具?(SillyTavern?其他?)
- 需要我幫你寫翻譯專用的 router 設定嗎?
- 你主要用哪個前端工具?(SillyTavern?其他?)
有任何錯誤(401、模型無法使用、翻譯卡頓等)直接貼給我,我立刻幫你調整!
這樣設定正確嗎? Key Settings Edit Settings Key ID 99d83310b90ac7c41a6d5b2114d41d8e6894efc16500a262ce01b3b4ac8b50c9 Key Alias qroq translator Secret Key sk-…dV7g Team ID Not Set Organization Not Set Created Jun 25, 2026 at 11:25 PM Expires Never Auto-Rotation Auto-Rotation Disabled Auto-rotation is not enabled for this key Spend $0.0000 USD Budget Unlimited Tags No tags specified Prompts No prompts specified Allowed Routes llm_api_routes Allowed Pass Through Routes No pass through routes specified Disable Global Guardrails Disabled - Global guardrails active Models groq/llama-3.3-70b-versatile Rate Limits TPM: Unlimited RPM: Unlimited Max Parallel Requests: Unlimited Model TPM Limits: Unlimited Model RPM Limits: Unlimited Metadata
{}Object Permissions Vector Stores 0 No vector stores configured MCP Servers 0 No MCP servers, access groups, or toolsets configured Agents 0 No agents or access groups configured Search tools No restriction — all configured search tools are allowed for this team. Logging Settings Logging Integrations0 No logging integrations configured Disabled Callbacks0 No callbacks disabled
✅ 整體設定大致正確,但有幾個地方可以優化,尤其是用在「浸沉翻譯」(Immersion Translation)場景。
以下是針對你提供的 Key Settings 的詳細分析與建議:
✅ 正確的部分
- 模型設定 :groq/llama-3.3-70b-versatile 是有效的 LiteLLM Groq 模型名稱。LiteLLM 完全支援 Groq,所有模型只要加上 groq/ 前綴即可。
- Key Alias :qroq translator(應該是 Groq)很清楚,方便辨識用途。
- Unlimited Budget / Rate Limits :個人使用沒問題,方便測試浸沉翻譯(不會輕易被卡住)。
- No expiration :適合長期用在 SillyTavern 等工具。
- Allowed Routes :保留 llm_api_routes 就足夠翻譯使用。
⚠️ 需要改進的地方(推薦調整)
- Rate Limits 建議設限制
- 目前 Unlimited 雖然方便,但 Groq 本身有免費額度/Rate Limit。
- 建議把 RPM 設為 60~120 , TPM 設為 1,000,000~2,000,000 。
- 理由:浸沉翻譯時容易連續大量呼叫,設限制可避免突然被 Groq 封鎖或浪費額度。
- 目前 Unlimited 雖然方便,但 Groq 本身有免費額度/Rate Limit。
- 模型選擇(針對翻譯)
- llama-3.3-70b-versatile 能力很強,但速度較慢、成本較高。
- 翻譯專用推薦 :
- groq/llama-3.1-8b-instant(超快,適合純翻譯) - groq/llama-3.3-70b-versatile(主聊天 + 高品質翻譯)
- 最好建立 兩個 Virtual Key :
- 一個專門翻譯(用小模型) - 一個主聊天(用大模型)
- llama-3.3-70b-versatile 能力很強,但速度較慢、成本較高。
- Metadata(可加)
- 目前是空物件 {}
- 可以加上註記,例如:
{ "purpose": "immersion-translation", "tool": "sillytavern", "language": "chinese-english" }
- 目前是空物件 {}
推薦優化後的設定方式
在 LiteLLM UI 修改現有 Key(或新建一個)
- 進入 Keys → 點擊你的 Key → Edit Settings
- 調整以下項目:
- Models :保留 groq/llama-3.3-70b-versatile(或再加 groq/llama-3.1-8b-instant)
- RPM Limit :80
- TPM Limit :1500000
- Max Parallel Requests :10(避免同時太多請求)
- Metadata :加上上面建議的 JSON
- Models :保留 groq/llama-3.3-70b-versatile(或再加 groq/llama-3.1-8b-instant)
config.yaml 也可加強(選用)
在你的 config.yaml 加入專門的翻譯模型:
model_list:
- model_name: groq-translator-fast
litellm_params:
model: groq/llama-3.1-8b-instant
api_key: os.environ/GROQ_API_KEY # 記得先加 GROQ_API_KEY 到 docker-compose
- model_name: groq-translator-quality
litellm_params:
model: groq/llama-3.3-70b-versatile
api_key: os.environ/GROQ_API_KEY然後在 Virtual Key 的 Models 欄位填 groq-translator-fast 或 groq-translator-quality。
在 SillyTavern / 浸沉工具的使用方式
- API Base URL :http://你的VPS\_IP:4000/v1
- API Key :sk-…dV7g(你目前的 Secret Key)
- Model :填 groq/llama-3.3-70b-versatile 或你在 LiteLLM 自訂的 groq-translator-quality
翻譯提示詞建議 (System Prompt):
你是一位專業的中英浸沉式翻譯助手。請只輸出翻譯後的自然流暢的中文,保留原意、語氣和角色扮演風格,不要添加任何解釋。總結:目前設定能用,但建議盡快加上 Rate Limit 保護,並考慮再建一個「fast translator」Key。
你現在是用這個 Key 接 SillyTavern 嗎? 測試時有沒有遇到 Rate Limit、翻譯品質、延遲等問題?
把測試結果或想調整的方向告訴我,我可以給你更精準的 config 片段或提示詞優化!