
Cloudflare Workers AI 是 Cloudflare 推出的 serverless AI 推理服务,依托其全球边缘网络(300+ 城市节点),让开发者无需管理 GPU 服务器即可在离用户最近的节点上运行大模型推理。与 Groq、Cerebras 等专注极速推理的平台不同,Workers AI 的核心优势在于边缘部署 + 免费 Neurons 额度 + 与 Cloudflare 生态深度集成——你可以直接在 Worker 函数中绑定 AI 模型,实现延迟极低的推理 API。
本文将全面解析 Cloudflare Workers AI 的免费额度、可用模型、注册流程、API 调用示例、付费价格以及中国用户可用性,帮助开发者快速上手这一免费 AI 推理平台。最近一次验证日期:2026年9月27日。
一、是否需要绑卡?注册门槛详解
Cloudflare Workers AI 的注册门槛非常低,这也是它区别于 AWS Bedrock、Azure OpenAI 等平台的重要优势:
| 项目 | 免费计划(Free Plan) | Workers 付费计划($5/月) |
|---|---|---|
| 是否需要绑卡 | ❌ 不需要 | ✅ 需要信用卡或 PayPal |
| 账号注册 | 仅需邮箱 | 邮箱 + 支付方式 |
| Workers AI 可用 | ✅ 可用(有限额) | ✅ 可用(更高限额) |
| 每日免费 Neurons | 10,000 neurons/天 | 10,000 neurons/天(额外付费扩展) |
| Workers 请求量 | 100,000 次/天 | 1,000万次/月 |
关键结论:免费计划完全不需要绑卡,仅需邮箱注册即可使用 Workers AI。 这意味着中国开发者可以零成本上手,无需虚拟信用卡。如果你需要更高的请求量或更低的延迟,再考虑升级到 $5/月的 Workers Paid 计划。
二、免费额度是多少?Neurons 计费模型解析
Cloudflare Workers AI 使用 Neurons(神经元) 作为计量单位,而不是传统的 token 数。这是一个抽象的计算单位,综合考虑了模型大小、输入/输出 token 数、推理复杂度等因素。不同模型的 Neurons 消耗率不同:
| 模型类别 | 代表模型 | 每 1000 Neurons 约可处理 |
|---|---|---|
| 小模型(7B级) | Llama 3.2 3B、Qwen2.5 7B | ~1,300 tokens 输入 + ~500 tokens 输出 |
| 中模型(8B-14B) | Llama 3.1 8B、Mistral 7B | ~800 tokens 输入 + ~300 tokens 输出 |
| 大模型(70B级) | Llama 3.1 70B | ~150 tokens 输入 + ~50 tokens 输出 |
| 嵌入模型 | bge-m3、all-MiniLM-L6-v2 | ~10,000 tokens 输入 |
| 图像模型 | stable-diffusion-xl | ~1 张图(512×512) |
| 语音识别 | whisper-tiny | ~100 秒音频 |
免费额度总结:
- 每天 10,000 Neurons(UTC 00:00 重置,北京时间 08:00)
- 每月无额外总量上限(每日重置)
- 10,000 Neurons 大约可以支持每天 50-200 次中等长度的对话推理(取决于模型和 prompt 长度)
- 嵌入模型消耗极低,适合做大规模文本向量化

三、可用模型列表与限速配置
截至2026年9月,Cloudflare Workers AI 支持的模型已超过 50 个,涵盖文本生成、嵌入、图像生成、语音识别、翻译等多个类别。以下是核心模型列表:
文本生成模型(Text Generation)
| 模型 ID | 模型名称 | 参数量 | 上下文长度 |
|---|---|---|---|
| @cf/meta/llama-3.1-8b-instruct | Llama 3.1 8B | 8B | 8,192 |
| @cf/meta/llama-3.1-70b-instruct | Llama 3.1 70B | 70B | 8,192 |
| @cf/meta/llama-3.2-3b-instruct | Llama 3.2 3B | 3B | 128,000 |
| @cf/meta/llama-3.2-1b-instruct | Llama 3.2 1B | 1B | 128,000 |
| @cf/meta/llama-3.3-70b-instruct | Llama 3.3 70B | 70B | 128,000 |
| @cf/mistral/mistral-7b-instruct | Mistral 7B | 7B | 32,000 |
| @cf/qwen/qwen2.5-coder-32b-instruct | Qwen2.5 Coder 32B | 32B | 32,000 |
| @cf/qwen/qwq-32b | QwQ 32B(推理模型) | 32B | 32,000 |
| @cf/google/gemma-2-9b-it | Gemma 2 9B | 9B | 8,192 |
| @cf/deepseek/deepseek-r1-distill-qwen-32b | DeepSeek R1 Distill 32B | 32B | 80,000 |
其他类型模型
- 嵌入模型:bge-m3、baai/bge-base-en、all-MiniLM-L6-v2
- 图像生成:stable-diffusion-xl、stable-diffusion-v1-5
- 语音识别:whisper-tiny、whisper-large-v3
- 文本分类:distilbert-sst-2-int8
- 翻译:m2m100-1.2b(多语言翻译)
限速规则:
- 免费计划:10,000 Neurons/天 + 50 请求/分钟(单 IP)
- 付费计划($5/月):10,000 Neurons/天 + 1,000 请求/分钟
- 超出每日免费 Neurons 后,付费计划自动按量计费,免费计划则返回 429 错误
- Llama 3.1 70B 等大模型在免费计划下有更严格的并发限制(建议并发 < 5)
四、注册步骤:从零开始使用 Workers AI
以下是完整的注册和启用 Workers AI 的步骤:
步骤 1:注册 Cloudflare 账号
访问 https://dash.cloudflare.com/sign-up,使用邮箱注册。无需信用卡,无需手机验证。建议使用 Gmail 或 Outlook 邮箱,QQ 邮箱可能收不到验证邮件。
步骤 2:进入 Workers & Pages 控制台
登录后,在左侧导航栏点击 “Workers & Pages”,然后点击 “Create application” → “Create Worker”。系统会自动为你分配一个 workers.dev 子域名。
步骤 3:创建第一个 AI Worker
在 Worker 编辑器中粘贴以下代码:
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17 export default {
async fetch(request, env) {
// 调用 Llama 3.1 8B 模型
const response = await env.AI.run(
"@cf/meta/llama-3.1-8b-instruct",
{
messages: [
{ role: "system", content: "你是一个有帮助的AI助手,用中文回答问题。" },
{ role: "user", content: "请用三句话介绍Cloudflare Workers AI。" }
],
max_tokens: 256
}
);
return Response.json(response);
}
};
步骤 4:绑定 AI 模型
在 Worker 的 “Settings” → “Bindings” 中,点击 “Add binding”,选择 “Workers AI”,设置变量名为
1 | AI |
,选择生产环境。保存后部署即可。
步骤 5:获取 REST API Token(可选)
如果你需要通过 HTTP REST API 调用(而不是 Worker 绑定),可以在 Cloudflare Dashboard → “My Profile” → “API Tokens” 创建 API Token,选择 “Workers AI: Read” 权限。
五、API 调用示例:多种方式调用 Workers AI
方式 1:REST API(curl 调用)
通过 Cloudflare 的 REST API,你可以直接用 HTTP 请求调用模型,无需部署 Worker:
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17 # 设置环境变量
export CF_API_TOKEN="你的API_Token"
export CF_ACCOUNT_ID="你的Account_ID"
# 调用 Llama 3.1 8B 模型
curl -X POST \
"https://api.cloudflare.com/client/v4/accounts/$CF_ACCOUNT_ID/ai/run/@cf/meta/llama-3.1-8b-instruct" \
-H "Authorization: Bearer $CF_API_TOKEN" \
-H "Content-Type: application/json" \
-d '{
"messages": [
{"role": "system", "content": "你是中文AI助手"},
{"role": "user", "content": "解释什么是Neurons计费"}
],
"max_tokens": 512,
"temperature": 0.7
}'
返回结果格式:
1
2
3
4
5
6
7
8
9
10
11
12
13 {
"result": {
"response": "Neurons是Cloudflare Workers AI的计量单位...",
"usage": {
"prompt_tokens": 45,
"completion_tokens": 128,
"total_tokens": 173
}
},
"success": true,
"errors": [],
"messages": []
}
方式 2:Python SDK 调用
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31 import requests
import os
API_TOKEN = os.getenv("CF_API_TOKEN")
ACCOUNT_ID = os.getenv("CF_ACCOUNT_ID")
url = f"https://api.cloudflare.com/client/v4/accounts/{ACCOUNT_ID}/ai/run/@cf/meta/llama-3.2-3b-instruct"
headers = {
"Authorization": f"Bearer {API_TOKEN}",
"Content-Type": "application/json"
}
payload = {
"messages": [
{"role": "system", "content": "你是一个专业的技术文档翻译助手。"},
{"role": "user", "content": "将以下英文翻译为中文:Workers AI runs on Cloudflare's global network."}
],
"max_tokens": 256,
"temperature": 0.3,
"stream": False
}
response = requests.post(url, headers=headers, json=payload)
data = response.json()
if data["success"]:
print("模型回复:", data["result"]["response"])
print("Token用量:", data["result"]["usage"])
else:
print("错误:", data["errors"])
方式 3:流式输出(Streaming)
Workers AI 支持 SSE 流式输出,适合实时对话场景:
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20 import requests
import json
url = f"https://api.cloudflare.com/client/v4/accounts/{ACCOUNT_ID}/ai/run/@cf/meta/llama-3.1-8b-instruct"
payload = {
"messages": [{"role": "user", "content": "写一首关于边缘计算的诗"}],
"max_tokens": 512,
"stream": True # 启用流式输出
}
response = requests.post(url, headers=headers, json=payload, stream=True)
for line in response.iter_lines():
if line:
chunk = line.decode("utf-8")
if chunk.startswith("data: "):
data = json.loads(chunk[6:])
if "response" in data:
print(data["response"], end="", flush=True)
方式 4:嵌入向量生成
1
2
3
4
5
6
7
8
9
10
11
12
13
14 # 使用 bge-m3 生成文本嵌入向量
url = f"https://api.cloudflare.com/client/v4/accounts/{ACCOUNT_ID}/ai/run/@cf/baai/bge-m3"
payload = {
"text": ["Cloudflare Workers AI提供边缘推理", "Groq专注于极速推理"]
}
response = requests.post(url, headers=headers, json=payload)
data = response.json()
if data["success"]:
embeddings = data["result"]["data"]
print(f"生成了 {len(embeddings)} 个向量,维度: {len(embeddings[0])}")
# 输出: 生成了 2 个向量,维度: 1024

六、额度用完后的费用:Neurons 定价表
当每日 10,000 免费 Neurons 用完后,付费计划(Workers Paid $5/月)的用户会自动按量计费。以下是 2026 年最新定价:
| 项目 | 免费计划 | Workers Paid($5/月) |
|---|---|---|
| 每日免费 Neurons | 10,000 | 10,000 |
| 超出后价格 | 不可用(返回 429) | $0.63 / 100万 Neurons |
| Neurons → Tokens 换算 | — | 约 $0.30-0.60 / 100万 tokens(视模型) |
| Workers 请求 | 10万次/天 | 1000万次/月(含) |
| 超出 Workers 请求 | 不可用 | $0.30 / 100万次 |
| KV 读取 | 10万次/天 | 1000万次/月(含) |
| KV 写入 | 1,000次/天 | 100万次/月(含) |
费用估算示例: 假设你使用 Llama 3.1 8B 模型,每天进行 500 次对话推理(每次约 500 tokens 输入 + 200 tokens 输出),消耗约 3,000 Neurons/天。在免费计划下完全免费。如果日调用量增加到 5,000 次对话,则每日消耗约 30,000 Neurons,超出免费额度 20,000 Neurons,每日额外费用约 $0.013,月费用约 $0.39(加上 $5 基础费 = $5.39/月)。
相比 OpenAI GPT-4o-mini($0.15/100万 input tokens + $0.60/100万 output tokens),Cloudflare Workers AI 在中小模型推理上的价格非常有竞争力,尤其是免费额度足以支撑中小型应用的日常使用。
七、中国用户可用性:网络延迟与访问测试
Cloudflare 在中国大陆的访问情况比较特殊,需要分别讨论:
7.1 API 直接访问
| 访问方式 | 中国大陆直连 | 说明 |
|---|---|---|
| api.cloudflare.com(REST API) | ⚠️ 不稳定 | 部分ISP可能被DNS污染或间歇性超时 |
| workers.dev(Worker域名) | ❌ 多数被墙 | workers.dev 域名在中国大陆普遍无法访问 |
| 自定义域名(绑定自有域名) | ✅ 可用 | 通过 Cloudflare CDN 回源,多数可用 |
7.2 延迟测试数据
从中国大陆(电信/联通/移动)到 Cloudflare 各区域节点的延迟实测:
| 节点区域 | 电信延迟(ms) | 联通延迟(ms) | 移动延迟(ms) |
|---|---|---|---|
| 香港(HKG) | 30-50 | 35-60 | 40-70 |
| 东京(NRT) | 60-90 | 55-85 | 70-100 |
| 新加坡(SIN) | 80-120 | 90-130 | 100-150 |
| 圣何塞(SJC) | 150-200 | 160-210 | 180-250 |
中国用户使用建议:
- 如果仅用于 API 调用(后端服务),建议绑定自有域名(已备案或海外域名均可),通过 Cloudflare 的 Anycast 网络回源
- 如果需要在中国大陆直接访问 Worker,必须绑定自定义域名,workers.dev 域名不可用
- 延迟方面,香港节点对国内用户最友好,推理请求往返延迟约 60-100ms(加上模型推理时间,总延迟约 200-500ms)
- 不建议将 Workers AI 作为面向中国大陆用户的直接前端服务,更适合作为后端推理引擎
八、同类服务横向对比
将 Cloudflare Workers AI 与其他主流免费 AI 推理平台进行对比:
| 对比项 | Cloudflare Workers AI | Groq | Cerebras | DeepSeek API | HuggingFace |
|---|---|---|---|---|---|
| 是否需要绑卡 | ❌ 不需要 | ❌ 不需要 | ❌ 不需要 | ❌ 不需要 | ❌ 不需要 |
| 免费额度 | 10K Neurons/天 | 30 RPM / 14K tokens/min | 1,000 tokens/s 免费 | 有限免费体验 | 有限免费调用 |
| 可用模型数 | 50+ | ~10 | ~5 | ~10(自研) | 10万+ |
| 代表性模型 | Llama 3.3 70B、Qwen2.5、DeepSeek R1 | Llama 3.3 70B | Llama 3.1 8B、Qwen | DeepSeek V3/R1 | 各类开源模型 |
| 推理速度 | 中等(边缘部署) | 极快(LPU) | 极快(CS-3晶圆) | 快 | 慢(排队) |
| 流式输出 | ✅ SSE | ✅ SSE | ✅ SSE | ✅ SSE | ✅ SSE |
| 嵌入模型 | ✅ bge-m3 等 | ❌ | ❌ | ❌ | ✅ |
| 图像生成 | ✅ SDXL | ❌ | ❌ | ❌ | 部分 |
| 语音识别 | ✅ Whisper | ❌ | ❌ | ❌ | 部分 |
| 中国可用性 | ⚠️ 需绑域名 | ⚠️ 不稳定 | ⚠️ 不稳定 | ✅ 可用 | ⚠️ 不稳定 |
| 超出后价格 | $0.63/百万Neurons | $0.59/百万tokens | 按量付费 | ¥1-2/百万tokens | 按实例付费 |
| 独特优势 | 边缘部署+多模态 | 极致速度 | 极致速度 | 最强性价比 | 模型最全 |
从对比可以看出,Cloudflare Workers AI 的核心差异化在于多模态支持(文本+图像+语音+嵌入)+ 边缘部署能力 + 与 Cloudflare 生态(KV、D1、R2等)无缝集成。如果你的应用场景需要多种 AI 能力(比如同时需要文本推理和向量化检索),Workers AI 是一站式解决方案。如果只需要极速文本推理,Groq 或 Cerebras 更合适。
九、实战案例:用 Workers AI 搭建免费 RAG 系统
以下是一个利用 Cloudflare 生态(Workers AI + D1 数据库 + KV 缓存)搭建简易 RAG 系统的示例:
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61 // Worker 代码:结合 D1 数据库 + Workers AI 实现简易 RAG
export default {
async fetch(request, env) {
const url = new URL(request.url);
// 1. 接收用户查询
const query = url.searchParams.get("q") || "什么是边缘AI推理";
// 2. 生成查询向量
const embedding = await env.AI.run("@cf/baai/bge-m3", {
text: [query]
});
const queryVector = embedding.data[0];
// 3. 从 KV 缓存中检索相似文档(简化版)
const cacheKey = `doc:latest`;
const cachedDocs = await env.DOC_KV.get(cacheKey, "json");
// 4. 计算余弦相似度排序
let bestDoc = "";
let bestScore = -1;
for (const doc of cachedDocs || []) {
const score = cosineSimilarity(queryVector, doc.embedding);
if (score > bestScore) {
bestScore = score;
bestDoc = doc.text;
}
}
// 5. 调用 LLM 生成最终回答
const answer = await env.AI.run("@cf/meta/llama-3.1-8b-instruct", {
messages: [
{
role: "system",
content: `你是一个问答助手。根据以下参考信息回答用户问题。
参考信息:${bestDoc}`
},
{ role: "user", content: query }
],
max_tokens: 512
});
return Response.json({
query,
answer: answer.response,
similarity: bestScore.toFixed(4),
source: bestDoc.substring(0, 100) + "..."
});
}
};
// 余弦相似度计算
function cosineSimilarity(a, b) {
let dot = 0, normA = 0, normB = 0;
for (let i = 0; i < a.length; i++) {
dot += a[i] * b[i];
normA += a[i] * a[i];
normB += b[i] * b[i];
}
return dot / (Math.sqrt(normA) * Math.sqrt(normB));
}
这个 RAG 系统完全运行在 Cloudflare 边缘节点上,不需要外部 GPU 服务器。每日 10,000 免费 Neurons 足以支持数百次查询。你可以在 Cloudflare Workers AI 免费推理服务实战指南 中了解更多基础用法。
十、总结与使用建议
Cloudflare Workers AI 是目前免费 AI 推理平台中多模态能力最全面、生态集成度最高的选择。以下是我的使用建议:
- 适合场景:需要多种 AI 能力(文本+嵌入+图像+语音)的应用、需要在边缘节点低延迟推理的场景、已有 Cloudflare 基础设施的团队
- 不适合场景:需要超高并发推理(Groq/Cerebras 更快)、需要 GPT-4 级别闭源模型、需要中国大陆直接访问(workers.dev 被墙)
- 省钱技巧:小模型(Llama 3.2 1B/3B)消耗极少 Neurons,适合做简单分类/摘要;嵌入模型 bge-m3 性价比极高,适合大规模向量化
- 中国开发者注意:必须绑定自定义域名才能在中国使用,API Token 调用也需要通过代理或自定义域名
验证日期:2026年9月27日。 Cloudflare Workers AI 的免费额度和模型列表更新频繁,建议定期查看 官方模型文档 获取最新信息。如果你正在寻找更多免费 AI 推理资源,可以参考我们整理的 2026年免费AI推理API横向对比评测 和 DeepSeek API 免费额度全攻略。
汤不热吧