一句话定位
LLM API 不一定要花钱。Ollama 跑本地模型不要钱,NVIDIA 送你免费额度也不限速——
两条路对应两种场景,搞清楚边界就能省不少。
2025 年中回头看,API 调用的门槛已经低到了一个奇怪的程度:
你自己的 GPU 可以跑开源模型(Ollama),云厂商也愿意白送推理额度(NVIDIA)。
问题已经不是「有没有免费的 key」,而是「哪个适合我现在的场景」。
入口 A:Ollama —— 本地跑,零成本,无限次
一句话
你有一张 NVIDIA 显卡,Ollama 让你两行命令跑起一个 LLM,局域网内当 API 用。
怎么装
# 装 ollama
curl -fsSL https://ollama.com/install.sh | sh
# 拉一个模型
ollama pull llama3.2:1b # 轻量,随便什么显卡都能跑
ollama pull qwen2.5:7b # 中文好,7B 需要 6G+ VRAM
ollama pull deepseek-r1:7b # 推理强,适合 agent
# 启动服务(默认 :11434)
ollama serve
装完就有了一个本地 localhost:11434 的 OpenAI 兼容 API:
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "qwen2.5:7b",
"messages": [{"role": "user", "content": "你好"}]
}'
什么时候用它
| 场景 | 合适吗 | 原因 |
|---|---|---|
| 开发调试、频繁调 prompt | ✅ 首选 | 零成本,不限量 |
| 离线环境 / 内网隔离 | ✅ 唯一选择 | 不需要外网 |
| 隐私数据(代码 / 文档) | ✅ 数据不出本机 | 完全本地 |
| agent 高频调工具 | ✅ 不心疼 | 没有按 token 计费 |
| 需要最强模型(Claude 4 / GPT-5) | ❌ | 本地跑不动 |
| 生产环境高并发 | ❌ | 单卡 QPS 有限 |
实际体验
我自己的用法:
- 写博客时预览翻译:
qwen2.5:7b做中英对照,延迟 200-400ms,够用 - agent 内测:
deepseek-r1:7b跑工具判断逻辑,不心疼调用量 - 批处理:读 log、格式化 JSON、批量 rewrite,Ollama 当后台进程挂着
一句话:本地有的模型就用本地,本地没有的再考虑云端。
入口 B:NVIDIA —— 免费的云端推理
一句话
NVIDIA 给开发者送免费 API 额度,注册就有,不需要绑信用卡。
跑的是他们自己的 NIM 容器优化过的模型,延迟不差。
怎么拿 key
- 打开 build.nvidia.com
- 右上角 Sign In → 用 GitHub / Google 登录
- 进任何一个模型页(比如 llama / mixtral / nemotron),点「Get API Key」
- 自动生成一个
nvapi-xxx开头的 key,复制走
全程 2 分钟,不需要手机验证,不需要绑卡。
怎么用
NVIDIA 的 API 也是 OpenAI 兼容的:
from openai import OpenAI
client = OpenAI(
base_url="https://integrate.api.nvidia.com/v1",
api_key="$NVAPI_KEY"
)
resp = client.chat.completions.create(
model="nvidia/llama-3.1-nemotron-70b-instruct",
messages=[{"role": "user", "content": "你好"}]
)
print(resp.choices[0].message.content)
额度与限制
目前(2025 中)的情况:
- 免费额度:注册即送,每天约 1000 次请求(非精确计数,实际很宽裕)
- 速率限制:比 OpenAI 免费 tier 宽松,60 req/min
- 可用模型:llama / nemotron / mixtral / mistral / deepseek 等几十个
- 上下文:多数 128K
- SSE 流式:支持
跟 Ollama 的区别:
| 维度 | Ollama | NVIDIA |
|---|---|---|
| 费用 | 0(电费不算) | 0(有每日限额) |
| 模型选择 | 本地能跑多少 | 云端几十个随时换 |
| 模型大小 | <= 70B(取决于显卡) | 70B ~ 400B+ |
| 延迟 | 快(本地) | 快(NIM 优化) |
| 可靠性 | 取决于你的显卡 | 99.9%(NVIDIA 托管) |
| 隐私 | 数据不出本机 | 数据经过 NVIDIA |
| 需要 GPU | ✅ 必须 | ❌ 不用 |
什么时候用它
- 本地显卡不够跑大模型(>= 70B)
- 需要多个模型快速切换测试
- 开发机没 GPU(笔记本 / Mac)
- 临时需要一个稳定的云端端点跑 CI / 测试
两者组合的典型工作流
我自己现在的 setup:
日常开发 / agent 内测
|
Ollama(本地) ← 不限量,随便调
|
效果不满意 / 需要更强模型
|
NVIDIA(云端) ← 免费 key,按需切
|
还不够?
|
MiniMax / 其他付费 API
三层漏斗,每一层都有免费的选项兜底,最后一层才掏钱。
大多数场景在 Ollama 那层就解决了。
还有一个选择:GitHub Models
顺带一提,GitHub 也送了免费额度。有 GitHub Copilot 订阅的话,
可以在 github.com/marketplace/models 拿 key,
免费调 GPT-4o / Claude 3.5 / Gemini,每天有配额但够用。
跟 OpenAI 直连的区别是 base_url 不同,SDK 改一行就行。
// 免费的比你想的多,只是藏在注册流程后面。