一句话定位

LLM API 不一定要花钱。Ollama 跑本地模型不要钱,NVIDIA 送你免费额度也不限速——
两条路对应两种场景,搞清楚边界就能省不少。

2025 年中回头看,API 调用的门槛已经低到了一个奇怪的程度:
你自己的 GPU 可以跑开源模型(Ollama),云厂商也愿意白送推理额度(NVIDIA)。
问题已经不是「有没有免费的 key」,而是「哪个适合我现在的场景」。

入口 A:Ollama —— 本地跑,零成本,无限次

一句话

你有一张 NVIDIA 显卡,Ollama 让你两行命令跑起一个 LLM,局域网内当 API 用。

怎么装

# 装 ollama
curl -fsSL https://ollama.com/install.sh | sh

# 拉一个模型
ollama pull llama3.2:1b       # 轻量,随便什么显卡都能跑
ollama pull qwen2.5:7b        # 中文好,7B 需要 6G+ VRAM
ollama pull deepseek-r1:7b    # 推理强,适合 agent

# 启动服务(默认 :11434)
ollama serve

装完就有了一个本地 localhost:11434 的 OpenAI 兼容 API:

curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen2.5:7b",
    "messages": [{"role": "user", "content": "你好"}]
  }'

什么时候用它

场景 合适吗 原因
开发调试、频繁调 prompt ✅ 首选 零成本,不限量
离线环境 / 内网隔离 ✅ 唯一选择 不需要外网
隐私数据(代码 / 文档) ✅ 数据不出本机 完全本地
agent 高频调工具 ✅ 不心疼 没有按 token 计费
需要最强模型(Claude 4 / GPT-5) 本地跑不动
生产环境高并发 单卡 QPS 有限

实际体验

我自己的用法:

  • 写博客时预览翻译qwen2.5:7b 做中英对照,延迟 200-400ms,够用
  • agent 内测deepseek-r1:7b 跑工具判断逻辑,不心疼调用量
  • 批处理:读 log、格式化 JSON、批量 rewrite,Ollama 当后台进程挂着

一句话:本地有的模型就用本地,本地没有的再考虑云端。

入口 B:NVIDIA —— 免费的云端推理

一句话

NVIDIA 给开发者送免费 API 额度,注册就有,不需要绑信用卡。
跑的是他们自己的 NIM 容器优化过的模型,延迟不差。

怎么拿 key

  1. 打开 build.nvidia.com
  2. 右上角 Sign In → 用 GitHub / Google 登录
  3. 进任何一个模型页(比如 llama / mixtral / nemotron),点「Get API Key」
  4. 自动生成一个 nvapi-xxx 开头的 key,复制走

全程 2 分钟,不需要手机验证,不需要绑卡

怎么用

NVIDIA 的 API 也是 OpenAI 兼容的:

from openai import OpenAI

client = OpenAI(
    base_url="https://integrate.api.nvidia.com/v1",
    api_key="$NVAPI_KEY"
)

resp = client.chat.completions.create(
    model="nvidia/llama-3.1-nemotron-70b-instruct",
    messages=[{"role": "user", "content": "你好"}]
)
print(resp.choices[0].message.content)

额度与限制

目前(2025 中)的情况:

  • 免费额度:注册即送,每天约 1000 次请求(非精确计数,实际很宽裕)
  • 速率限制:比 OpenAI 免费 tier 宽松,60 req/min
  • 可用模型:llama / nemotron / mixtral / mistral / deepseek 等几十个
  • 上下文:多数 128K
  • SSE 流式:支持

跟 Ollama 的区别:

维度 Ollama NVIDIA
费用 0(电费不算) 0(有每日限额)
模型选择 本地能跑多少 云端几十个随时换
模型大小 <= 70B(取决于显卡) 70B ~ 400B+
延迟 快(本地) 快(NIM 优化)
可靠性 取决于你的显卡 99.9%(NVIDIA 托管)
隐私 数据不出本机 数据经过 NVIDIA
需要 GPU ✅ 必须 ❌ 不用

什么时候用它

  • 本地显卡不够跑大模型(>= 70B)
  • 需要多个模型快速切换测试
  • 开发机没 GPU(笔记本 / Mac)
  • 临时需要一个稳定的云端端点跑 CI / 测试

两者组合的典型工作流

我自己现在的 setup:

日常开发 / agent 内测
        |
   Ollama(本地) ← 不限量,随便调
        |
   效果不满意 / 需要更强模型
        |
   NVIDIA(云端) ← 免费 key,按需切
        |
   还不够?
        |
   MiniMax / 其他付费 API

三层漏斗,每一层都有免费的选项兜底,最后一层才掏钱。
大多数场景在 Ollama 那层就解决了。

还有一个选择:GitHub Models

顺带一提,GitHub 也送了免费额度。有 GitHub Copilot 订阅的话,
可以在 github.com/marketplace/models 拿 key,
免费调 GPT-4o / Claude 3.5 / Gemini,每天有配额但够用。

跟 OpenAI 直连的区别是 base_url 不同,SDK 改一行就行。


// 免费的比你想的多,只是藏在注册流程后面。