欢迎光临

Cloudflare Workers AI 免费推理API全攻略:Neurons额度、模型列表、REST API调用与中国可用性详解

Cloudflare Workers AI 免费推理API架构示意

Cloudflare Workers AI 是 Cloudflare 推出的 serverless AI 推理服务,依托其全球边缘网络(300+ 城市节点),让开发者无需管理 GPU 服务器即可在离用户最近的节点上运行大模型推理。与 Groq、Cerebras 等专注极速推理的平台不同,Workers AI 的核心优势在于边缘部署 + 免费 Neurons 额度 + 与 Cloudflare 生态深度集成——你可以直接在 Worker 函数中绑定 AI 模型,实现延迟极低的推理 API。

本文将全面解析 Cloudflare Workers AI 的免费额度、可用模型、注册流程、API 调用示例、付费价格以及中国用户可用性,帮助开发者快速上手这一免费 AI 推理平台。最近一次验证日期:2026年9月27日。

一、是否需要绑卡?注册门槛详解

Cloudflare Workers AI 的注册门槛非常低,这也是它区别于 AWS Bedrock、Azure OpenAI 等平台的重要优势:

项目 免费计划(Free Plan) Workers 付费计划($5/月)
是否需要绑卡 ❌ 不需要 ✅ 需要信用卡或 PayPal
账号注册 仅需邮箱 邮箱 + 支付方式
Workers AI 可用 ✅ 可用(有限额) ✅ 可用(更高限额)
每日免费 Neurons 10,000 neurons/天 10,000 neurons/天(额外付费扩展)
Workers 请求量 100,000 次/天 1,000万次/月

关键结论:免费计划完全不需要绑卡,仅需邮箱注册即可使用 Workers AI。 这意味着中国开发者可以零成本上手,无需虚拟信用卡。如果你需要更高的请求量或更低的延迟,再考虑升级到 $5/月的 Workers Paid 计划。

二、免费额度是多少?Neurons 计费模型解析

Cloudflare Workers AI 使用 Neurons(神经元) 作为计量单位,而不是传统的 token 数。这是一个抽象的计算单位,综合考虑了模型大小、输入/输出 token 数、推理复杂度等因素。不同模型的 Neurons 消耗率不同:

模型类别 代表模型 每 1000 Neurons 约可处理
小模型(7B级) Llama 3.2 3B、Qwen2.5 7B ~1,300 tokens 输入 + ~500 tokens 输出
中模型(8B-14B) Llama 3.1 8B、Mistral 7B ~800 tokens 输入 + ~300 tokens 输出
大模型(70B级) Llama 3.1 70B ~150 tokens 输入 + ~50 tokens 输出
嵌入模型 bge-m3、all-MiniLM-L6-v2 ~10,000 tokens 输入
图像模型 stable-diffusion-xl ~1 张图(512×512)
语音识别 whisper-tiny ~100 秒音频

免费额度总结:

  • 每天 10,000 Neurons(UTC 00:00 重置,北京时间 08:00)
  • 每月无额外总量上限(每日重置)
  • 10,000 Neurons 大约可以支持每天 50-200 次中等长度的对话推理(取决于模型和 prompt 长度)
  • 嵌入模型消耗极低,适合做大规模文本向量化

Cloudflare Workers AI Neurons 额度消耗示意

三、可用模型列表与限速配置

截至2026年9月,Cloudflare Workers AI 支持的模型已超过 50 个,涵盖文本生成、嵌入、图像生成、语音识别、翻译等多个类别。以下是核心模型列表:

文本生成模型(Text Generation)

模型 ID 模型名称 参数量 上下文长度
@cf/meta/llama-3.1-8b-instruct Llama 3.1 8B 8B 8,192
@cf/meta/llama-3.1-70b-instruct Llama 3.1 70B 70B 8,192
@cf/meta/llama-3.2-3b-instruct Llama 3.2 3B 3B 128,000
@cf/meta/llama-3.2-1b-instruct Llama 3.2 1B 1B 128,000
@cf/meta/llama-3.3-70b-instruct Llama 3.3 70B 70B 128,000
@cf/mistral/mistral-7b-instruct Mistral 7B 7B 32,000
@cf/qwen/qwen2.5-coder-32b-instruct Qwen2.5 Coder 32B 32B 32,000
@cf/qwen/qwq-32b QwQ 32B(推理模型) 32B 32,000
@cf/google/gemma-2-9b-it Gemma 2 9B 9B 8,192
@cf/deepseek/deepseek-r1-distill-qwen-32b DeepSeek R1 Distill 32B 32B 80,000

其他类型模型

  • 嵌入模型:bge-m3、baai/bge-base-en、all-MiniLM-L6-v2
  • 图像生成:stable-diffusion-xl、stable-diffusion-v1-5
  • 语音识别:whisper-tiny、whisper-large-v3
  • 文本分类:distilbert-sst-2-int8
  • 翻译:m2m100-1.2b(多语言翻译)

限速规则:

  • 免费计划:10,000 Neurons/天 + 50 请求/分钟(单 IP)
  • 付费计划($5/月):10,000 Neurons/天 + 1,000 请求/分钟
  • 超出每日免费 Neurons 后,付费计划自动按量计费,免费计划则返回 429 错误
  • Llama 3.1 70B 等大模型在免费计划下有更严格的并发限制(建议并发 < 5)

四、注册步骤:从零开始使用 Workers AI

以下是完整的注册和启用 Workers AI 的步骤:

步骤 1:注册 Cloudflare 账号

访问 https://dash.cloudflare.com/sign-up,使用邮箱注册。无需信用卡,无需手机验证。建议使用 Gmail 或 Outlook 邮箱,QQ 邮箱可能收不到验证邮件。

步骤 2:进入 Workers & Pages 控制台

登录后,在左侧导航栏点击 “Workers & Pages”,然后点击 “Create application” → “Create Worker”。系统会自动为你分配一个 workers.dev 子域名。

步骤 3:创建第一个 AI Worker

在 Worker 编辑器中粘贴以下代码:


1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
export default {
  async fetch(request, env) {
    // 调用 Llama 3.1 8B 模型
    const response = await env.AI.run(
      "@cf/meta/llama-3.1-8b-instruct",
      {
        messages: [
          { role: "system", content: "你是一个有帮助的AI助手,用中文回答问题。" },
          { role: "user", content: "请用三句话介绍Cloudflare Workers AI。" }
        ],
        max_tokens: 256
      }
    );

    return Response.json(response);
  }
};

步骤 4:绑定 AI 模型

在 Worker 的 “Settings” → “Bindings” 中,点击 “Add binding”,选择 “Workers AI”,设置变量名为

1
AI

,选择生产环境。保存后部署即可。

步骤 5:获取 REST API Token(可选)

如果你需要通过 HTTP REST API 调用(而不是 Worker 绑定),可以在 Cloudflare Dashboard → “My Profile” → “API Tokens” 创建 API Token,选择 “Workers AI: Read” 权限。

五、API 调用示例:多种方式调用 Workers AI

方式 1:REST API(curl 调用)

通过 Cloudflare 的 REST API,你可以直接用 HTTP 请求调用模型,无需部署 Worker:


1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
# 设置环境变量
export CF_API_TOKEN="你的API_Token"
export CF_ACCOUNT_ID="你的Account_ID"

# 调用 Llama 3.1 8B 模型
curl -X POST \
  "https://api.cloudflare.com/client/v4/accounts/$CF_ACCOUNT_ID/ai/run/@cf/meta/llama-3.1-8b-instruct" \
  -H "Authorization: Bearer $CF_API_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "messages": [
      {"role": "system", "content": "你是中文AI助手"},
      {"role": "user", "content": "解释什么是Neurons计费"}
    ],
    "max_tokens": 512,
    "temperature": 0.7
  }'

返回结果格式:


1
2
3
4
5
6
7
8
9
10
11
12
13
{
  "result": {
    "response": "Neurons是Cloudflare Workers AI的计量单位...",
    "usage": {
      "prompt_tokens": 45,
      "completion_tokens": 128,
      "total_tokens": 173
    }
  },
  "success": true,
  "errors": [],
  "messages": []
}

方式 2:Python SDK 调用


1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
import requests
import os

API_TOKEN = os.getenv("CF_API_TOKEN")
ACCOUNT_ID = os.getenv("CF_ACCOUNT_ID")

url = f"https://api.cloudflare.com/client/v4/accounts/{ACCOUNT_ID}/ai/run/@cf/meta/llama-3.2-3b-instruct"

headers = {
    "Authorization": f"Bearer {API_TOKEN}",
    "Content-Type": "application/json"
}

payload = {
    "messages": [
        {"role": "system", "content": "你是一个专业的技术文档翻译助手。"},
        {"role": "user", "content": "将以下英文翻译为中文:Workers AI runs on Cloudflare's global network."}
    ],
    "max_tokens": 256,
    "temperature": 0.3,
    "stream": False
}

response = requests.post(url, headers=headers, json=payload)
data = response.json()

if data["success"]:
    print("模型回复:", data["result"]["response"])
    print("Token用量:", data["result"]["usage"])
else:
    print("错误:", data["errors"])

方式 3:流式输出(Streaming)

Workers AI 支持 SSE 流式输出,适合实时对话场景:


1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
import requests
import json

url = f"https://api.cloudflare.com/client/v4/accounts/{ACCOUNT_ID}/ai/run/@cf/meta/llama-3.1-8b-instruct"

payload = {
    "messages": [{"role": "user", "content": "写一首关于边缘计算的诗"}],
    "max_tokens": 512,
    "stream": True  # 启用流式输出
}

response = requests.post(url, headers=headers, json=payload, stream=True)

for line in response.iter_lines():
    if line:
        chunk = line.decode("utf-8")
        if chunk.startswith("data: "):
            data = json.loads(chunk[6:])
            if "response" in data:
                print(data["response"], end="", flush=True)

方式 4:嵌入向量生成


1
2
3
4
5
6
7
8
9
10
11
12
13
14
# 使用 bge-m3 生成文本嵌入向量
url = f"https://api.cloudflare.com/client/v4/accounts/{ACCOUNT_ID}/ai/run/@cf/baai/bge-m3"

payload = {
    "text": ["Cloudflare Workers AI提供边缘推理", "Groq专注于极速推理"]
}

response = requests.post(url, headers=headers, json=payload)
data = response.json()

if data["success"]:
    embeddings = data["result"]["data"]
    print(f"生成了 {len(embeddings)} 个向量,维度: {len(embeddings[0])}")
    # 输出: 生成了 2 个向量,维度: 1024

Cloudflare Workers AI REST API 调用流程

六、额度用完后的费用:Neurons 定价表

当每日 10,000 免费 Neurons 用完后,付费计划(Workers Paid $5/月)的用户会自动按量计费。以下是 2026 年最新定价:

项目 免费计划 Workers Paid($5/月)
每日免费 Neurons 10,000 10,000
超出后价格 不可用(返回 429) $0.63 / 100万 Neurons
Neurons → Tokens 换算 — 约 $0.30-0.60 / 100万 tokens(视模型)
Workers 请求 10万次/天 1000万次/月(含)
超出 Workers 请求 不可用 $0.30 / 100万次
KV 读取 10万次/天 1000万次/月(含)
KV 写入 1,000次/天 100万次/月(含)

费用估算示例: 假设你使用 Llama 3.1 8B 模型,每天进行 500 次对话推理(每次约 500 tokens 输入 + 200 tokens 输出),消耗约 3,000 Neurons/天。在免费计划下完全免费。如果日调用量增加到 5,000 次对话,则每日消耗约 30,000 Neurons,超出免费额度 20,000 Neurons,每日额外费用约 $0.013,月费用约 $0.39(加上 $5 基础费 = $5.39/月)。

相比 OpenAI GPT-4o-mini($0.15/100万 input tokens + $0.60/100万 output tokens),Cloudflare Workers AI 在中小模型推理上的价格非常有竞争力,尤其是免费额度足以支撑中小型应用的日常使用。

七、中国用户可用性:网络延迟与访问测试

Cloudflare 在中国大陆的访问情况比较特殊,需要分别讨论:

7.1 API 直接访问

访问方式 中国大陆直连 说明
api.cloudflare.com(REST API) ⚠️ 不稳定 部分ISP可能被DNS污染或间歇性超时
workers.dev(Worker域名) ❌ 多数被墙 workers.dev 域名在中国大陆普遍无法访问
自定义域名(绑定自有域名) ✅ 可用 通过 Cloudflare CDN 回源,多数可用

7.2 延迟测试数据

从中国大陆(电信/联通/移动)到 Cloudflare 各区域节点的延迟实测:

节点区域 电信延迟(ms) 联通延迟(ms) 移动延迟(ms)
香港(HKG) 30-50 35-60 40-70
东京(NRT) 60-90 55-85 70-100
新加坡(SIN) 80-120 90-130 100-150
圣何塞(SJC) 150-200 160-210 180-250

中国用户使用建议:

  • 如果仅用于 API 调用(后端服务),建议绑定自有域名(已备案或海外域名均可),通过 Cloudflare 的 Anycast 网络回源
  • 如果需要在中国大陆直接访问 Worker,必须绑定自定义域名,workers.dev 域名不可用
  • 延迟方面,香港节点对国内用户最友好,推理请求往返延迟约 60-100ms(加上模型推理时间,总延迟约 200-500ms)
  • 不建议将 Workers AI 作为面向中国大陆用户的直接前端服务,更适合作为后端推理引擎

八、同类服务横向对比

将 Cloudflare Workers AI 与其他主流免费 AI 推理平台进行对比:

对比项 Cloudflare Workers AI Groq Cerebras DeepSeek API HuggingFace
是否需要绑卡 ❌ 不需要 ❌ 不需要 ❌ 不需要 ❌ 不需要 ❌ 不需要
免费额度 10K Neurons/天 30 RPM / 14K tokens/min 1,000 tokens/s 免费 有限免费体验 有限免费调用
可用模型数 50+ ~10 ~5 ~10(自研) 10万+
代表性模型 Llama 3.3 70B、Qwen2.5、DeepSeek R1 Llama 3.3 70B Llama 3.1 8B、Qwen DeepSeek V3/R1 各类开源模型
推理速度 中等(边缘部署) 极快(LPU) 极快(CS-3晶圆) 快 慢(排队)
流式输出 ✅ SSE ✅ SSE ✅ SSE ✅ SSE ✅ SSE
嵌入模型 ✅ bge-m3 等 ❌ ❌ ❌ ✅
图像生成 ✅ SDXL ❌ ❌ ❌ 部分
语音识别 ✅ Whisper ❌ ❌ ❌ 部分
中国可用性 ⚠️ 需绑域名 ⚠️ 不稳定 ⚠️ 不稳定 ✅ 可用 ⚠️ 不稳定
超出后价格 $0.63/百万Neurons $0.59/百万tokens 按量付费 ¥1-2/百万tokens 按实例付费
独特优势 边缘部署+多模态 极致速度 极致速度 最强性价比 模型最全

从对比可以看出,Cloudflare Workers AI 的核心差异化在于多模态支持(文本+图像+语音+嵌入)+ 边缘部署能力 + 与 Cloudflare 生态(KV、D1、R2等)无缝集成。如果你的应用场景需要多种 AI 能力(比如同时需要文本推理和向量化检索),Workers AI 是一站式解决方案。如果只需要极速文本推理,Groq 或 Cerebras 更合适。

九、实战案例:用 Workers AI 搭建免费 RAG 系统

以下是一个利用 Cloudflare 生态(Workers AI + D1 数据库 + KV 缓存)搭建简易 RAG 系统的示例:


1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
// Worker 代码:结合 D1 数据库 + Workers AI 实现简易 RAG
export default {
  async fetch(request, env) {
    const url = new URL(request.url);

    // 1. 接收用户查询
    const query = url.searchParams.get("q") || "什么是边缘AI推理";

    // 2. 生成查询向量
    const embedding = await env.AI.run("@cf/baai/bge-m3", {
      text: [query]
    });
    const queryVector = embedding.data[0];

    // 3. 从 KV 缓存中检索相似文档(简化版)
    const cacheKey = `doc:latest`;
    const cachedDocs = await env.DOC_KV.get(cacheKey, "json");

    // 4. 计算余弦相似度排序
    let bestDoc = "";
    let bestScore = -1;
    for (const doc of cachedDocs || []) {
      const score = cosineSimilarity(queryVector, doc.embedding);
      if (score > bestScore) {
        bestScore = score;
        bestDoc = doc.text;
      }
    }

    // 5. 调用 LLM 生成最终回答
    const answer = await env.AI.run("@cf/meta/llama-3.1-8b-instruct", {
      messages: [
        {
          role: "system",
          content: `你是一个问答助手。根据以下参考信息回答用户问题。
参考信息:${bestDoc}`
        },
        { role: "user", content: query }
      ],
      max_tokens: 512
    });

    return Response.json({
      query,
      answer: answer.response,
      similarity: bestScore.toFixed(4),
      source: bestDoc.substring(0, 100) + "..."
    });
  }
};

// 余弦相似度计算
function cosineSimilarity(a, b) {
  let dot = 0, normA = 0, normB = 0;
  for (let i = 0; i < a.length; i++) {
    dot += a[i] * b[i];
    normA += a[i] * a[i];
    normB += b[i] * b[i];
  }
  return dot / (Math.sqrt(normA) * Math.sqrt(normB));
}

这个 RAG 系统完全运行在 Cloudflare 边缘节点上,不需要外部 GPU 服务器。每日 10,000 免费 Neurons 足以支持数百次查询。你可以在 Cloudflare Workers AI 免费推理服务实战指南 中了解更多基础用法。

十、总结与使用建议

Cloudflare Workers AI 是目前免费 AI 推理平台中多模态能力最全面、生态集成度最高的选择。以下是我的使用建议:

  • 适合场景:需要多种 AI 能力(文本+嵌入+图像+语音)的应用、需要在边缘节点低延迟推理的场景、已有 Cloudflare 基础设施的团队
  • 不适合场景:需要超高并发推理(Groq/Cerebras 更快)、需要 GPT-4 级别闭源模型、需要中国大陆直接访问(workers.dev 被墙)
  • 省钱技巧:小模型(Llama 3.2 1B/3B)消耗极少 Neurons,适合做简单分类/摘要;嵌入模型 bge-m3 性价比极高,适合大规模向量化
  • 中国开发者注意:必须绑定自定义域名才能在中国使用,API Token 调用也需要通过代理或自定义域名

验证日期:2026年9月27日。 Cloudflare Workers AI 的免费额度和模型列表更新频繁,建议定期查看 官方模型文档 获取最新信息。如果你正在寻找更多免费 AI 推理资源,可以参考我们整理的 2026年免费AI推理API横向对比评测 和 DeepSeek API 免费额度全攻略。

【本站文章皆为原创,未经允许不得转载】:汤不热吧 » Cloudflare Workers AI 免费推理API全攻略:Neurons额度、模型列表、REST API调用与中国可用性详解
分享到: 更多 (0)