NVIDIA免费API

NVIDIA 提供了免费的 NIM (NVIDIA Inference Microservices) API ,允许开发者通过 build.nvidia.com 免费访问 80+(甚至 100+)个领先 AI 模型,包括 DeepSeek、GLM、Kimi、Qwen、Llama、Nemotron 等,支持 OpenAI 兼容接口,无需信用卡,主要用于原型开发、测试和个人/研究用途。

如何获取和使用免费 NVIDIA API

  1. 注册/登录 :
  2. 生成 API Key :
    • 登录后,在右上角头像 → API Keys → Generate API Key。
      • Key 格式通常为 nvapi-…,仅显示一次,妥善保存。
      • 部分模型页面点击 “Get API Key” 即可。
  3. 调用方式 (OpenAI 兼容):
from openai import OpenAI
 
client = OpenAI(
    base_url="https://integrate.api.nvidia.com/v1",
    api_key="你的_nvapi_key"
)
 
response = client.chat.completions.create(
    model="deepseek-ai/deepseek-v4"  # 或其他模型 ID,在 catalog 中查看
    messages=[{"role": "user", "content": "Hello!"}],
    temperature=0.7
)
 
print(response.choices[0].message.content)
  • 支持大多数支持 OpenAI 格式的工具(如 LangChain、LlamaIndex、SillyTavern、Cursor、Claude Code 等)。

免费额度与限制(2026 年现状)

  • 免费模型 :许多模型(如 GLM-5.1、MiniMax、DeepSeek 等)完全免费推理,无需消耗 credits。
  • Rate Limit :通常约 40 requests per minute (RPM) ,模型和流量相关(非固定 SLA)。高峰期可能更严格。
  • Credits :早期有 1000-5000 credits 机制,现在主要转为 rate-limit 为主。个人账号可通过 dashboard “Request More” 申请增加。
  • 使用场景 :适合原型、测试、个人开发。生产环境建议自托管 NIM 或购买 NVIDIA AI Enterprise。

限流处理建议 :

  • 等待片刻重试(429 错误后)。
  • 切换不同模型测试速度。
  • 论坛请求提高限流(提供用途,如个人开发),部分用户成功从 40 RPM 提高,但非保证。

可用模型示例

平台有大量模型,包括:

  • 编码/推理 :DeepSeek V4、Qwen3、GLM-5.1、Kimi K2.5、Nemotron 等。
  • 多模态 :支持图像/视频的模型。
  • 在 catalog 中搜索并查看具体 model ID、上下文长度、性能指标。

优势与注意事项

优势 :

  • 模型丰富 :一次性访问多家顶级模型(国产 + 国际)。
  • 性能好 :NVIDIA DGX Cloud 托管,推理速度快。
  • 兼容性高 :OpenAI SDK 一行切换。
  • 完全免费 :无时间限制(用于开发/测试),无需 GPU。

注意/限制 :

  • 主要为 开发/原型 ,非生产级 SLA。
  • 限流存在,适合个人/轻度使用,重度依赖建议自托管 NIM(下载容器在本地或云 GPU 运行)。
  • 部分高级功能或企业模型可能需 NVIDIA AI Enterprise 许可。
  • 遵守 NVIDIA 服务条款,避免滥用。

其他 NVIDIA 免费资源

  • NGC (NVIDIA GPU Cloud) :下载容器、模型,需 API Key(不同用途)。
  • 自托管 NIM :免费下载微服务,在自己的 GPU 上运行,无 API 调用限制。
  • 文档 :查看 developer.nvidia.com/nim 和官方 FAQ。

推荐起步 :立即去 build.nvidia.com 试用几个热门模型,体验速度和效果。如果你遇到具体问题(如某个模型 ID、集成代码、限流),可以提供更多细节,我可以进一步帮忙调试或推荐替代方案。享受免费的强大 AI 能力!

剛剛申請了NVIDIA api key, 怎樣放入LiteLLM?

✅ 把 NVIDIA API Key 放入 LiteLLM 的完整指南 (2026 年最新方式)

LiteLLM 對 NVIDIA NIM 支援非常好,直接用 nvidia_nim/ 前綴即可路由到 https://integrate.api.nvidia.com/v1。

1. 最簡單方式:設定環境變數(推薦個人使用)

# Linux / macOS
export NVIDIA_NIM_API_KEY="nvapi-你的完整key這裡"
 
# Windows PowerShell
$env:NVIDIA_NIM_API_KEY = "nvapi-你的完整key這裡"

或在 Python 程式碼開頭設定:

import os
os.environ['NVIDIA_NIM_API_KEY'] = "nvapi-你的完整key這裡"

測試呼叫 :

from litellm import completion
import os
 
# 如果還沒設定環境變數,就在這裡設定
# os.environ['NVIDIA_NIM_API_KEY'] = "nvapi-..."
 
response = completion(
    model="nvidia_nim/deepseek-ai/deepseek-v4",   # 替換成你想用的模型
    messages=[{"role": "user", "content": "你好,請自我介紹"}],
    temperature=0.7
)
 
print(response.choices[0].message.content)

常見模型前綴範例 (去 build.nvidia.com 看完整 model ID):

  • nvidia_nim/deepseek-ai/deepseek-v4
  • nvidia_nim/qwen/qwen3-235b-a22b
  • nvidia_nim/z-ai/glm5
  • nvidia_nim/moonshotai/kimi-k2.5
  • nvidia_nim/meta/llama3-70b-instruct 等

2. 使用 LiteLLM Proxy Server(強烈推薦用在 Claude Code、SillyTavern、Cursor 等工具)

建立一個 config.yaml:

model_list:
  - model_name: deepseek-v4          # 你自訂的名稱,之後在其他工具使用這個
    litellm_params:
      model: nvidia_nim/deepseek-ai/deepseek-v4   # 必須加 nvidia_nim/ 前綴
      api_key: os.environ/NVIDIA_NIM_API_KEY      # 推薦這樣寫,安全
      # api_base: https://integrate.api.nvidia.com/v1   # 可選,預設就是這個
 
  - model_name: qwen3-235b
    litellm_params:
      model: nvidia_nim/qwen/qwen3-235b-a22b
      api_key: os.environ/NVIDIA_NIM_API_KEY
 
litellm_settings:
  drop_params: true   # 很重要!避免 Anthropic 特有參數出錯
 
general_settings:
  master_key: "sk-123456"   # 自訂 proxy 的 master key

啟動 Proxy:

litellm --config config.yaml

之後其他工具就把 base_url 設為 http://0.0.0.0:4000 或 http://localhost:4000,api\_key 填 sk-123456 即可。

Docker 啟動方式 (方便持久化):

docker run -d \
  -p 4000:4000 \
  -e NVIDIA_NIM_API_KEY="nvapi-你的key" \
  -v $(pwd)/config.yaml:/app/config.yaml \
  --name litellm-nim \
  docker.litellm.ai/berriai/litellm:main-stable \
  --config /app/config.yaml

注意事項與常見問題

  • API Key 安全 :不要直接寫死在程式碼或 config.yaml 裡,優先用 os.environ/NVIDIA_NIM_API_KEY 或.env 檔。
  • Rate Limit :免費帳號大約 40 RPM,高峰期可能更嚴。遇到 429 就等一下或申請提高限流。
  • drop_params: true :如果用在 Claude Code 或其他非 OpenAI 格式的工具,一定要加,否則容易出錯。
  • 查可用模型 :可以用 curl 查詢:
    curl https://integrate.api.nvidia.com/v1/models \
      -H "Authorization: Bearer nvapi-你的key"
  • 自訂 base_url :如果想改,可以在 litellm_params 裡加 api_base。

想現在就測試嗎? 把你的 NVIDIA key 設定好後,直接跑上面第一段 Python 程式碼試試看。

有遇到任何錯誤(例如模型 ID 找不到、429、認証失敗等),把錯誤訊息貼給我,我幫你 debug! 也可以告訴我你主要想用在哪個工具(Claude Code、SillyTavern、LangChain、Cursor…),我給更針對性的設定。

我在Oracle cloud vps 用docker 安裝litellm,我現在在 Litellm v.1.91.0 介面,怎樣設定NVIDIA key

✅ 在 Oracle Cloud VPS Docker + LiteLLM v1.91.0 設定 NVIDIA API Key 的完整步驟

你目前在 LiteLLM UI 介面,推薦 兩種主要方式 :

  1. Docker 環境變數 + config.yaml (最穩定,推薦)
  2. 直接在 LiteLLM UI 透過 LLM Credentials 設定 (較方便,但仍建議搭配 config)

方式 1:Docker 環境變數 + config.yaml(推薦生產使用)

步驟 1:建立或編輯 config.yaml

在你的 VPS 上,進入 LiteLLM config 目錄(通常是你 -v 掛載的資料夾,例如 /root/litellm/):

cd /你的/config/路徑   # 例如 cd ~/litellm
nano config.yaml

加入以下內容(可多次新增不同模型):

model_list:
  - model_name: deepseek-v4          # 你自訂的名稱,之後在 UI 或其他工具使用
    litellm_params:
      model: nvidia_nim/deepseek-ai/deepseek-v4   # 必須加 nvidia_nim/ 前綴
      api_key: os.environ/NVIDIA_NIM_API_KEY      # 推薦這樣寫(安全)
      # api_base: https://integrate.api.nvidia.com/v1   # 可選,預設就是這個
 
  - model_name: qwen3-235b
    litellm_params:
      model: nvidia_nim/qwen/qwen3-235b-a22b
      api_key: os.environ/NVIDIA_NIM_API_KEY
 
litellm_settings:
  drop_params: true   # 很重要!避免其他工具傳參數出錯
 
general_settings:
  master_key: "sk-你的自訂masterkey"   # 必須以 sk- 開頭

步驟 2:重啟 Docker 容器並注入 Key

停止舊容器後重新運行(替換成你的實際命令):

# 先停止舊容器
docker stop litellm   # 或你的容器名稱
 
# 重新運行(重點是 -e NVIDIA_NIM_API_KEY)
docker run -d \
  -p 4000:4000 \
  -e NVIDIA_NIM_API_KEY="nvapi-你的完整key" \
  -v /你的本地/config.yaml:/app/config.yaml \
  --name litellm \
  --restart always \
  docker.litellm.ai/berriai/litellm:main-stable \
  --config /app/config.yaml

提示 :

  • 使用 main-stable 或 main-latest 確保版本接近 v1.91.0。
  • 如果你用 docker compose,就把 NVIDIA_NIM_API_KEY 放在.env 檔裡,再用 ${NVIDIA_NIM_API_KEY} 引用。

方式 2:直接在 LiteLLM UI 設定(快速測試)

  1. 進入 LiteLLM UI(通常是 http://你的VPS\_IP:4000/ui)
  2. 用 master key 登入(admin 權限)
  3. 前往 Models → LLM Credentials → Add Credential
  4. 選擇 Provider: NVIDIA NIM
  5. 貼上你的 NVIDIA API Key (nvapi-…)
  6. 儲存
  7. 再去 Models → Add Model
    • Model Name:自訂(如 deepseek-v4)
      • LiteLLM Model:nvidia_nim/deepseek-ai/deepseek-v4
      • 選擇剛剛建立的 Credential
      • 儲存

這樣 UI 就會直接使用這個 credential。


驗證是否成功

在 VPS 上測試:

curl -X POST http://localhost:4000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer sk-你的masterkey" \
  -d '{
    "model": "deepseek-v4",
    "messages": [{"role": "user", "content": "你好,測試 NVIDIA"}]
  }'

或在 LiteLLM UI 的 Playground 直接選擇模型測試。


常見問題與注意事項(Oracle Cloud VPS)

  • 429 Rate Limit :免費 NVIDIA 約 40 RPM,遇到就等一下或申請提高。
  • 容器重啟後 Key 不見 :一定要用 -e NVIDIA_NIM_API_KEY 或.env 檔,不要只寫死在 config.yaml。
  • drop_params: true :如果你要接 Claude Code、SillyTavern、Cursor 等工具,務必加上。
  • 防火牆 :Oracle Cloud 記得在 Security List 開放 4000 端口。
  • 持久化 :強烈建議用 docker compose 管理,方便維護.env 和 config.yaml。
  • 版本 :v1.91.0 支援 NVIDIA NIM 很好,若有問題可考慮更新到最新 stable。

現在就試試看 :先用方式 1 把 Docker 重新跑起來,然後告訴我測試結果或任何錯誤訊息(例如 401、模型找不到、429 等),我幫你 debug。

你目前是用單純 docker run 還是 docker compose?有沒有把 config.yaml 掛載好?可以貼一下你的 docker run 指令,我幫你修改得更精準。

Failed to add model: ApiError: {‘error’: “Set ‘STORE_MODEL_IN_DB=‘True’ in your env to enable this feature.”}

✅ 解決錯誤:Failed to add model – 需要設定 STORE_MODEL_IN_DB=True

這個錯誤是因為 LiteLLM UI 的「新增模型」功能預設需要把模型資訊存到資料庫(Database),而你目前沒有啟用這個設定。

快速修正步驟(Docker 環境)

1. 修改 Docker 啟動指令(加入環境變數)

停止目前容器,然後用以下指令重新啟動(重點是加上 -e STORE_MODEL_IN_DB=True):

docker stop litellm   # 或你的容器名稱
 
docker run -d \
  -p 4000:4000 \
  -e NVIDIA_NIM_API_KEY="nvapi-你的完整key" \
  -e STORE_MODEL_IN_DB=True \
  -e LITELLM_MASTER_KEY="sk-你的masterkey" \   # 確保有這個
  -v /你的/config/路徑/config.yaml:/app/config.yaml \
  --name litellm \
  --restart always \
  docker.litellm.ai/berriai/litellm:main-stable \
  --config /app/config.yaml

2. 如果你使用 docker compose(強烈建議改用)

建立或修改 docker-compose.yml:

version: "3.9"
services:
  litellm:
    image: docker.litellm.ai/berriai/litellm:main-stable
    container_name: litellm
    ports:
      - "4000:4000"
    volumes:
      - ./config.yaml:/app/config.yaml
    environment:
      NVIDIA_NIM_API_KEY: "nvapi-你的完整key"
      STORE_MODEL_IN_DB: "True"
      LITELLM_MASTER_KEY: "sk-你的masterkey"   # 改成你自己的
      # 其他設定...
    restart: always

然後執行:

docker compose down
docker compose up -d

更完整的推薦設定(使用資料庫)

只設 STORE_MODEL_IN_DB=True 可能還不夠完整,因為 UI 模型管理功能最好搭配 PostgreSQL 使用(LiteLLM 官方推薦)。

如果你想用完整版,可以快速加一個 Postgres:

docker-compose.yml 範例 (包含 DB):

version: "3.9"
services:
  postgres:
    image: postgres:16
    container_name: litellm-db
    environment:
      POSTGRES_DB: litellm
      POSTGRES_USER: litellm
      POSTGRES_PASSWORD: 你的postgres密碼   # 改成強密碼
    volumes:
      - postgres_data:/var/lib/postgresql/data
    restart: always
 
  litellm:
    image: docker.litellm.ai/berriai/litellm:main-stable
    depends_on:
      - postgres
    ports:
      - "4000:4000"
    volumes:
      - ./config.yaml:/app/config.yaml
    environment:
      NVIDIA_NIM_API_KEY: "nvapi-你的完整key"
      DATABASE_URL: "postgresql://litellm:你的postgres密碼@postgres:5432/litellm"
      STORE_MODEL_IN_DB: "True"
      LITELLM_MASTER_KEY: "sk-你的masterkey"
    restart: always
 
volumes:
  postgres_data:

執行 docker compose up -d 後,LiteLLM 就會自動連資料庫。


設定完成後的操作

  1. 等待容器啟動(約 10-30 秒)。
  2. 進入 LiteLLM UI(http://你的VPS\_IP:4000/ui)。
  3. 用 master key 登入。
  4. 去 Models → Add Model 再試一次新增 NVIDIA 模型:
    • Model Name:deepseek-v4(自訂)
      • LiteLLM Model:nvidia_nim/deepseek-ai/deepseek-v4
      • 選擇或輸入 NVIDIA Credential(如果之前已加)

還是有問題?

  • 把你現在的 docker run 或 docker-compose.yml 完整內容貼給我(把 key 隱藏)。
  • 錯誤訊息如果有更新,也一起貼上。
  • 你目前是用單純 docker run 還是 compose?

這樣我可以給你最精準的修改指令。設定好之後就能在 UI 輕鬆管理所有模型了!

version: ‘3.8’ services: litellm: image: ghcr.io/berriai/litellm:main-latest container_name: litellm restart: unless-stopped expose: - “4000” environment: - LITELLM_MASTER_KEY=sk-change-this-to-a-secure-key-via-dockhand - LITELLM_SALT_KEY=sk-random-salt-key-change-this

# [核心修正] 將連線字串的主機名稱改為 litellm-db (連字號),符合 RFC 1123 規範

- DATABASE_URL=postgresql://litellm_user:Admin2026DBpwd@litellm-db:5432/litellm_proxy volumes: - /opt/docker/litellm/config.yaml:/app/config.yaml depends_on: litellm-db: # [核心修正] 依賴名稱同步更新 condition: service_healthy networks: - cf_network litellm-db: # [核心修正] 服務名稱更新為連字號 image: postgres:15-alpine container_name: litellm-db # [核心修正] 容器名稱更新 restart: unless-stopped environment: - POSTGRES_USER=litellm_user - POSTGRES_PASSWORD=Admin2026DBpwd - POSTGRES_DB=litellm_proxy volumes: - /opt/docker/litellm/pg_data:/var/lib/postgresql/data healthcheck: test: [“CMD-SHELL”, “pg_isready -U litellm_user -d litellm_proxy”] interval: 5s timeout: 5s retries: 5 networks: - cf_network networks: cf_network: external: true

✅ 你的 docker-compose.yml 需要補上關鍵環境變數

你的設定整體已經不錯(有 Postgres),但缺少 NVIDIA Key 和 STORE_MODEL_IN_DB=True ,導致無法在 UI 新增模型。

修改後的完整 docker-compose.yml(直接替換使用)

version: '3.8'
services:
  litellm:
    image: ghcr.io/berriai/litellm:main-latest
    container_name: litellm
    restart: unless-stopped
    ports:                    # 改用 ports 而非 expose,方便外部訪問
      - "4000:4000"
    environment:
      - LITELLM_MASTER_KEY=sk-change-this-to-a-secure-key-via-dockhand
      - LITELLM_SALT_KEY=sk-random-salt-key-change-this
      - STORE_MODEL_IN_DB=True           # ← 解決你目前錯誤的關鍵
      - NVIDIA_NIM_API_KEY=nvapi-你的完整key這裡   # ← 填你的 NVIDIA Key
      - DATABASE_URL=postgresql://litellm_user:Admin2026DBpwd@litellm-db:5432/litellm_proxy
    volumes:
      - /opt/docker/litellm/config.yaml:/app/config.yaml
    depends_on:
      litellm-db:
        condition: service_healthy
    networks:
      - cf_network
 
  litellm-db:
    image: postgres:15-alpine
    container_name: litellm-db
    restart: unless-stopped
    environment:
      - POSTGRES_USER=litellm_user
      - POSTGRES_PASSWORD=Admin2026DBpwd
      - POSTGRES_DB=litellm_proxy
    volumes:
      - /opt/docker/litellm/pg_data:/var/lib/postgresql/data
    healthcheck:
      test: ["CMD-SHELL", "pg_isready -U litellm_user -d litellm_proxy"]
      interval: 5s
      timeout: 5s
      retries: 5
    networks:
      - cf_network
 
networks:
  cf_network:
    external: true

修改重點說明

  1. 新增 STORE_MODEL_IN_DB=True → 解決你遇到的 Set ‘STORE_MODEL_IN_DB=True’ 錯誤。
  2. 新增 NVIDIA_NIM_API_KEY → 讓 LiteLLM 能使用你的 NVIDIA Key。
  3. 把 expose 改成 ports → 確保外部(包括 Cloudflare)能訪問 4000 端口。
  4. 其他保持不變(包含你修正過的連字號命名)。

操作步驟

  1. 把上面的內容複製覆蓋你的 docker-compose.yml。
  2. 把 nvapi-你的完整key這裡 替換成真實的 NVIDIA API Key。
  3. 執行以下指令更新:
cd /opt/docker/litellm/          # 進入你的 compose 目錄
docker compose down
docker compose up -d
  1. 等待 20~30 秒讓 Postgres 和 LiteLLM 啟動。
  2. 進入 LiteLLM UI:

推薦 config.yaml 內容(同步確認)

確認 /opt/docker/litellm/config.yaml 至少要有以下基本內容:

model_list:
  - model_name: deepseek-v4
    litellm_params:
      model: nvidia_nim/deepseek-ai/deepseek-v4
      api_key: os.environ/NVIDIA_NIM_API_KEY
 
litellm_settings:
  drop_params: true
 
general_settings:
  master_key: sk-change-this-to-a-secure-key-via-dockhand

完成後測試 :

  • 在 UI 的 Playground 或 Models 頁面新增模型測試。
  • 或用 curl 測試:
curl -X POST http://localhost:4000/v1/chat/completions \
  -H "Authorization: Bearer sk-change-this-to-a-secure-key-via-dockhand" \
  -H "Content-Type: application/json" \
  -d '{"model": "deepseek-v4", "messages": [{"role": "user", "content": "測試 NVIDIA 是否正常"}]}'

還有問題請直接回覆 :

  • 執行 docker compose up -d 後的 log(如果有錯誤)。
  • UI 是否還出現相同錯誤。
  • 或目前 docker compose logs 的輸出。

我會繼續幫你 debug,直到完全成功!

cloudflare worker AI key, 怎樣放入LiteLLM?

✅ 把 Cloudflare Workers AI Key 加入 LiteLLM(Docker + config.yaml 方式)

Cloudflare Workers AI 在 LiteLLM 中的支援很好,主要需要兩個資訊:

  • CLOUDFLARE_API_KEY (Cloudflare API Token)
  • CLOUDFLARE_ACCOUNT_ID (你的 Cloudflare 帳戶 ID)

步驟 1:取得 Cloudflare 必要資訊

  1. Cloudflare Account ID :
    • 登入 Cloudflare Dashboard
      • 點選任意一個 Domain → 右側會看到 Account ID (一串英數字)
  2. Cloudflare API Token :
    • 前往 https://dash.cloudflare.com/profile/api-tokens
      • 建立 Token → 選擇 Create Custom Token
      • 權限至少包含:
      • Account → Workers AI → Read + Edit - Account → AI Gateway → Read(可選)
      • 建立後複製 Token(格式通常是 xxxxxxxxxxxx)

步驟 2:修改 docker-compose.yml(推薦加入環境變數)

在你的 /opt/docker/litellm/docker-compose.yml 中, litellm service 的 environment 區塊加入以下兩行:

environment:
  - LITELLM_MASTER_KEY=sk-change-this-to-a-secure-key-via-dockhand
  - LITELLM_SALT_KEY=sk-random-salt-key-change-this
  - STORE_MODEL_IN_DB=True
  - NVIDIA_NIM_API_KEY=nvapi-你的NVIDIAkey
  - CLOUDFLARE_API_KEY=你的Cloudflare_API_Token     # ← 新增
  - CLOUDFLARE_ACCOUNT_ID=你的Cloudflare_Account_ID # ← 新增
  - DATABASE_URL=postgresql://litellm_user:Admin2026DBpwd@litellm-db:5432/litellm_proxy

修改完後執行:

cd /opt/docker/litellm
docker compose down
docker compose up -d

步驟 3:修改 config.yaml(加入 Cloudflare 模型)

編輯 /opt/docker/litellm/config.yaml,在 model_list 加入以下內容(可一次加多個模型):

model_list:
  # ... 你原本的 NVIDIA 模型 ...
 
  # Cloudflare Workers AI 模型範例
  - model_name: llama-3-8b-instruct-cf     # 自訂名稱,之後在 UI 或工具中使用
    litellm_params:
      model: cloudflare/@cf/meta/llama-3-8b-instruct
      api_key: os.environ/CLOUDFLARE_API_KEY
      # api_base 可省略,LiteLLM 會自動處理
 
  - model_name: mistral-7b-cf
    litellm_params:
      model: cloudflare/@cf/mistral/mistral-7b-instruct-v0.1
      api_key: os.environ/CLOUDFLARE_API_KEY
 
  - model_name: gemma-2-9b-cf
    litellm_params:
      model: cloudflare/@cf/google/gemma-2-9b-it
      api_key: os.environ/CLOUDFLARE_API_KEY
 
  # 更多模型可參考:https://developers.cloudflare.com/workers-ai/models/

推薦設定 (放在最上方):

litellm_settings:
  drop_params: true
  modify_params: true   # 對 Cloudflare 很有幫助

重啟後生效。


步驟 4:驗證是否成功

  1. 等容器啟動完(docker compose logs -f litellm 查看 log)。
  2. 在 LiteLLM UI(http://你的VPS\_IP:4000/ui)的 Playground 選擇 llama-3-8b-instruct-cf 測試。
  3. 或用 curl 測試:
curl -X POST http://localhost:4000/v1/chat/completions \
  -H "Authorization: Bearer sk-change-this-to-a-secure-key-via-dockhand" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "llama-3-8b-instruct-cf",
    "messages": [{"role": "user", "content": "你好,這是 Cloudflare Workers AI 測試"}]
  }'

注意事項(Cloudflare Workers AI)

  • 免費額度 :每天有一定免費額度(視模型而定),超過後按使用量收費。
  • 速度 :邊緣運算,延遲低,但大模型推理較慢。
  • 模型 ID :必須是 cloudflare/@cf/xxx 格式,完整清單看官方文件。
  • Rate Limit :LiteLLM 會幫你處理部分,但 Cloudflare 本身有限制。
  • UI 新增模型 :因為你已開 STORE_MODEL_IN_DB=True,也可以直接在 UI 的 Models → Add Model 手動新增(LiteLLM Model 填 cloudflare/@cf/meta/llama-3-8b-instruct)。

現在就試試 :把上面設定加上去,重啟容器後告訴我測試結果或任何錯誤訊息(例如 401、模型不存在、429 等),我會立刻幫你調整。

你目前想優先加哪幾個 Cloudflare 模型?(例如 Llama 3、Mistral、Gemma 等)我可以給你更精準的 config 片段。

LiteLLM api key, 怎樣取得?

✅ LiteLLM API Key(Master Key)取得與使用完整說明

在你目前的 Docker 設定中, LiteLLM API Key 就是你 docker-compose.yml 裡設定的 LITELLM_MASTER_KEY 。

1. 查看你目前的 LiteLLM Master Key

打開你的 docker-compose.yml:

cd /opt/docker/litellm
cat docker-compose.yml | grep LITELLM_MASTER_KEY

你應該會看到這一行:

- LITELLM_MASTER_KEY=sk-change-this-to-a-secure-key-via-dockhand

這個就是你的 LiteLLM API Key (預設是 sk-change-this-to-a-secure-key-via-dockhand)。


2. 強烈建議立即修改成安全的 Key

# 產生一個安全的隨機 Key(推薦)
openssl rand -hex 32
# 或用下面這行更像 OpenAI 格式
echo "sk-$(openssl rand -hex 24)"

然後修改 docker-compose.yml:

environment:
  - LITELLM_MASTER_KEY=sk-你自己產生的一串很長很安全的字串   # ← 改這裡
  - LITELLM_SALT_KEY=sk-另一個隨機的salt-key

修改完後重啟:

docker compose down
docker compose up -d

3. 如何使用這個 LiteLLM API Key

所有工具(Cursor、Claude Code、SillyTavern、OpenAI SDK、LangChain 等)都這樣使用:

Python 測試範例 :

from openai import OpenAI
 
client = OpenAI(
    base_url="http://你的VPS_IP:4000/v1",
    api_key="sk-你設定的master-key"
)
 
response = client.chat.completions.create(
    model="deepseek-v4",          # 或你設定的任何模型名稱
    messages=[{"role": "user", "content": "測試 LiteLLM 是否正常"}]
)
print(response.choices[0].message.content)

4. 進階:建立多個 Virtual Key(建議做法)

LiteLLM 支援建立多個子 Key(Virtual Keys),方便管理不同工具或使用者。

方法有兩種:

方法 A:在 LiteLLM UI 操作(最方便)

  1. 進入 http://你的VPS\_IP:4000/ui
  2. 用 Master Key 登入
  3. 左側選單 → Keys → + Create Key
  4. 設定名稱、預算、到期時間等 → 建立
  5. 複製產生的 Key(也是 sk- 開頭)

方法 B:用 API 建立

curl -X POST http://localhost:4000/key/generate \
  -H "Authorization: Bearer sk-你的master-key" \
  -H "Content-Type: application/json" \
  -d '{
    "key_alias": "cursor-key",
    "max_budget": 10
  }'

5. 常見問題

  • 忘記 Master Key → 直接修改 docker-compose.yml 後重啟即可。
  • Key 無效(401 錯誤) → 確認 Key 前後沒有空格,且以 sk- 開頭。
  • 想改 Key 不影響現有設定 → 改完 master key 後,所有舊的 virtual key 可能需要重新產生。
  • 安全性 :Master Key 權限最高,建議只用在伺服器內部或極少數信任工具,平常使用 Virtual Key 即可。

現在請告訴我 :

  1. 你目前 LITELLM_MASTER_KEY 的值是什麼?(可以打馬賽克中間部分)
  2. 你主要想把 LiteLLM 接在哪個工具上?(Cursor、Claude Code、SillyTavern、VS Code、其他?)

我可以給你對應工具最精準的設定方式。需要我幫你產生安全的 Key 也可以直接說!

Virtual Keys 可以用在浸沉或翻譯嗎?怎樣設定?

✅ 是的!LiteLLM 的 Virtual Keys 非常適合用在「浸沉翻譯」(Immersion Translation / Roleplay Translation)場景。

Virtual Keys 可以讓你為不同用途建立獨立的 API Key,方便控制預算、速率限制、特定模型,並且安全地用在 SillyTavern、RisuAI、Agnai、SillyTavern Extras、翻譯腳本等浸沉翻譯工具上。

1. Virtual Keys 的優點(浸沉翻譯場景)

  • 每個 Key 可以綁定特定模型(例如只允許 DeepSeek 或 Cloudflare 的翻譯模型)
  • 可以設定預算上限(避免意外高額消耗)
  • 可以設定 RPM / TPM 限制(防止翻譯時被 rate limit 卡住)
  • 可以設定到期時間
  • 不同工具用不同 Key,方便追蹤和管理

2. 如何建立 Virtual Key(兩種方式)

方式 A:在 LiteLLM UI 建立(最推薦)

  1. 進入 LiteLLM UI:http://你的VPS\_IP:4000/ui
  2. 用 Master Key 登入
  3. 左側選單點 Keys → + Create Key
  4. 填寫以下設定(針對浸沉翻譯推薦):
    • Key Name / Alias :例如 immersion-translation 或 sillytavern-key
      • Models :可以限制只能使用特定模型,例如:
      • deepseek-v4 - qwen3-235b - llama-3-8b-instruct-cf(Cloudflare)
      • Max Budget :例如 5(美元)或更高
      • TPM / RPM Limit :TPM 設高一點(如 1000000),RPM 設 60~120(翻譯時比較順)
      • Duration :可設 30 天或永不過期
      • Metadata :可加註記 {“purpose”: “immersion-translation”}
  5. 建立後 立即複製 產生的 Key(格式仍是 sk-…)

方式 B:用 curl 建立

curl -X POST http://localhost:4000/key/generate \
  -H "Authorization: Bearer sk-你的Master-Key" \
  -H "Content-Type: application/json" \
  -d '{
    "key_alias": "immersion-key",
    "models": ["deepseek-v4", "qwen3-235b"],
    "max_budget": 10,
    "tpm_limit": 2000000,
    "rpm_limit": 120,
    "duration": "30d"
  }'

3. 在浸沉翻譯工具中使用 Virtual Key

以 SillyTavern 為例(最常見) :

  1. 打開 SillyTavern
  2. 設定 → API → 選擇 OpenAI
  3. API URL 填:http://你的VPS\_IP:4000/v1
  4. API Key 填:剛剛建立的 Virtual Key
  5. Model 填:你在 LiteLLM 設的自訂名稱,例如 deepseek-v4 或 immersion-model
  6. 推薦額外設定:
    • Temperature:0.7~1.0(浸沉感較好)
      • Max Tokens:800~2000(視模型)
      • 開啟 Streaming (更即時)

翻譯專用設定(常見做法) :

很多浸沉玩家會建立 兩個 Key :

  • main-chat-key:用大模型(DeepSeek / Qwen)負責角色扮演
  • translation-key:用較快/便宜模型(Cloudflare Llama-3-8B 或 Gemma)專門翻譯

你也可以在 LiteLLM config.yaml 設定 fallback 或 router 來自動處理翻譯。


4. 推薦 config.yaml 加強浸沉體驗

在 /opt/docker/litellm/config.yaml 可以加上:

model_list:
  - model_name: immersion-main
    litellm_params:
      model: nvidia_nim/deepseek-ai/deepseek-v4
      api_key: os.environ/NVIDIA_NIM_API_KEY
 
  - model_name: immersion-translate
    litellm_params:
      model: cloudflare/@cf/meta/llama-3-8b-instruct
      api_key: os.environ/CLOUDFLARE_API_KEY
 
litellm_settings:
  drop_params: true
  modify_params: true
  fallbacks: 
    - "immersion-main": ["immersion-translate"]   # 主模型失敗時自動切換

重啟 LiteLLM 後生效。


現在就試試看 :

  1. 先在 UI 建立一個 immersion-key
  2. 複製 Key 後,馬上去 SillyTavern 或你的翻譯工具測試
  3. 測試成功後告訴我:
    • 你主要用哪個前端工具?(SillyTavern?其他?)
      • 需要我幫你寫翻譯專用的 router 設定嗎?

有任何錯誤(401、模型無法使用、翻譯卡頓等)直接貼給我,我立刻幫你調整!

這樣設定正確嗎? Key Settings Edit Settings Key ID 99d83310b90ac7c41a6d5b2114d41d8e6894efc16500a262ce01b3b4ac8b50c9 Key Alias qroq translator Secret Key sk-…dV7g Team ID Not Set Organization Not Set Created Jun 25, 2026 at 11:25 PM Expires Never Auto-Rotation Auto-Rotation Disabled Auto-rotation is not enabled for this key Spend $0.0000 USD Budget Unlimited Tags No tags specified Prompts No prompts specified Allowed Routes llm_api_routes Allowed Pass Through Routes No pass through routes specified Disable Global Guardrails Disabled - Global guardrails active Models groq/llama-3.3-70b-versatile Rate Limits TPM: Unlimited RPM: Unlimited Max Parallel Requests: Unlimited Model TPM Limits: Unlimited Model RPM Limits: Unlimited Metadata

{}

Object Permissions Vector Stores 0 No vector stores configured MCP Servers 0 No MCP servers, access groups, or toolsets configured Agents 0 No agents or access groups configured Search tools No restriction — all configured search tools are allowed for this team. Logging Settings Logging Integrations0 No logging integrations configured Disabled Callbacks0 No callbacks disabled

✅ 整體設定大致正確,但有幾個地方可以優化,尤其是用在「浸沉翻譯」(Immersion Translation)場景。

以下是針對你提供的 Key Settings 的詳細分析與建議:

✅ 正確的部分

  • 模型設定 :groq/llama-3.3-70b-versatile 是有效的 LiteLLM Groq 模型名稱。LiteLLM 完全支援 Groq,所有模型只要加上 groq/ 前綴即可。
  • Key Alias :qroq translator(應該是 Groq)很清楚,方便辨識用途。
  • Unlimited Budget / Rate Limits :個人使用沒問題,方便測試浸沉翻譯(不會輕易被卡住)。
  • No expiration :適合長期用在 SillyTavern 等工具。
  • Allowed Routes :保留 llm_api_routes 就足夠翻譯使用。

⚠️ 需要改進的地方(推薦調整)

  1. Rate Limits 建議設限制
    • 目前 Unlimited 雖然方便,但 Groq 本身有免費額度/Rate Limit。
      • 建議把 RPM 設為 60~120 , TPM 設為 1,000,000~2,000,000 。
      • 理由:浸沉翻譯時容易連續大量呼叫,設限制可避免突然被 Groq 封鎖或浪費額度。
  2. 模型選擇(針對翻譯)
    • llama-3.3-70b-versatile 能力很強,但速度較慢、成本較高。
      • 翻譯專用推薦 :
      • groq/llama-3.1-8b-instant(超快,適合純翻譯) - groq/llama-3.3-70b-versatile(主聊天 + 高品質翻譯)
      • 最好建立 兩個 Virtual Key :
      • 一個專門翻譯(用小模型) - 一個主聊天(用大模型)
  3. Metadata(可加)
    • 目前是空物件 {}
      • 可以加上註記,例如:
      {
        "purpose": "immersion-translation",
        "tool": "sillytavern",
        "language": "chinese-english"
      }

推薦優化後的設定方式

在 LiteLLM UI 修改現有 Key(或新建一個)

  1. 進入 Keys → 點擊你的 Key → Edit Settings
  2. 調整以下項目:
    • Models :保留 groq/llama-3.3-70b-versatile(或再加 groq/llama-3.1-8b-instant)
      • RPM Limit :80
      • TPM Limit :1500000
      • Max Parallel Requests :10(避免同時太多請求)
      • Metadata :加上上面建議的 JSON

config.yaml 也可加強(選用)

在你的 config.yaml 加入專門的翻譯模型:

model_list:
  - model_name: groq-translator-fast
    litellm_params:
      model: groq/llama-3.1-8b-instant
      api_key: os.environ/GROQ_API_KEY   # 記得先加 GROQ_API_KEY 到 docker-compose
 
  - model_name: groq-translator-quality
    litellm_params:
      model: groq/llama-3.3-70b-versatile
      api_key: os.environ/GROQ_API_KEY

然後在 Virtual Key 的 Models 欄位填 groq-translator-fast 或 groq-translator-quality。


在 SillyTavern / 浸沉工具的使用方式

  • API Base URL :http://你的VPS\_IP:4000/v1
  • API Key :sk-…dV7g(你目前的 Secret Key)
  • Model :填 groq/llama-3.3-70b-versatile 或你在 LiteLLM 自訂的 groq-translator-quality

翻譯提示詞建議 (System Prompt):

你是一位專業的中英浸沉式翻譯助手。請只輸出翻譯後的自然流暢的中文,保留原意、語氣和角色扮演風格,不要添加任何解釋。

總結:目前設定能用,但建議盡快加上 Rate Limit 保護,並考慮再建一個「fast translator」Key。

你現在是用這個 Key 接 SillyTavern 嗎? 測試時有沒有遇到 Rate Limit、翻譯品質、延遲等問題?

把測試結果或想調整的方向告訴我,我可以給你更精準的 config 片段或提示詞優化!