什么是 Nebius AI Cloud?
在免费 AI 算力资源日益紧缺的今天,Nebius AI Cloud 作为一股新兴力量,为开发者提供了极具竞争力的免费试用额度。Nebius 是一家总部位于荷兰阿姆斯特丹的云计算公司,由 Yandex 前高管创立,并在伦敦证券交易所上市(NLST: NBIS)。该公司专注于为 AI 开发者和数据科学家提供高性能计算基础设施,尤其在 GPU 算力和 AI 推理服务方面表现突出。
Nebius 的核心竞争力在于其拥有自己的 GPU 集群基础设施,不依赖第三方云厂商,因此在价格和性能上都有独特优势。对于想要免费体验高质量 AI 算力的开发者来说,Nebius 提供的 $5,000 新用户赠金是一个不容错过的机会。

Nebius 免费额度详解
Nebius 为新注册用户提供了丰厚的免费试用资源,具体包括以下几个方面:
1. 新用户赠金
新注册用户可获得最高 $5,000 的免费使用额度,有效期长达 60 天。这个额度足够你完成大量 AI 模型训练、推理测试和云服务部署。相比其他云厂商通常 $100-$300 的赠金,Nebius 的慷慨程度堪称业界领先。
2. 免费层服务
除了赠金之外,Nebius 还提供部分永久免费的服务层级,包括:
- Cloud Functions:每月 100 万次免费调用,适合部署无服务器 AI 推理端点
- Object Storage:1GB 免费存储空间,用于存放模型和数据
- IAM:身份和访问管理服务完全免费
- VPC 网络:基础网络功能免费使用
3. AI 推理 API 免费额度
Nebius 提供的 AI Studio 服务支持多种开源大模型的推理 API 调用,注册后即可获得一定量的免费 Token 额度,可用于体验 Llama 3、Qwen 2.5、DeepSeek 等主流开源模型的推理能力。
| 资源类型 | 免费额度 | 有效期 |
|---|---|---|
| 新用户赠金 | $5,000 | 60 天 |
| Cloud Functions | 100 万次/月 | 永久 |
| Object Storage | 1 GB | 永久 |
| AI Studio 推理 | 注册赠送 Token | 按额度 |
注册与账户设置
注册 Nebius 账户的流程非常简单,以下是从零开始的完整步骤:
第一步:创建账户
访问 cloud.nebius.ai 官网,点击”Get Started”按钮。你可以使用 Google 账号、GitHub 账号或邮箱注册。注册过程只需要一个有效的邮箱地址,无需绑定信用卡即可开始使用赠金额度。
第二步:完成身份验证
为了获得完整的赠金额度,你需要完成基本的身份验证。这通常包括:
- 填写个人或组织信息
- 可选:绑定支付方式以解锁更高额度(但不绑定也可以使用基础赠金)
第三步:创建项目和服务账户
登录控制台后,建议创建一个项目和对应的服务账户,用于 API 访问:
1
2
3
4
5
6
7
8
9
10
11 # 安装 Nebius CLI
curl -sSL https://storage.yandexcloud.net/yc/install.sh | bash
# 初始化配置
yc init
# 创建服务账户
yc iam service-account create --name ai-worker --description "Service account for AI workloads"
# 分配角色
yc resource-manager folder add-access-binding --service-account-name ai-worker --role editor --folder-id your-folder-id

GPU 算力实战:启动你的第一个 AI 虚拟机
Nebius 最强大的能力之一是提供高性能 GPU 虚拟机。以下是使用赠金额度启动 GPU 实例的完整流程。
可选的 GPU 实例类型
Nebius 提供多种 GPU 配置,满足不同规模的 AI 计算需求:
| 实例类型 | GPU | vCPU | 内存 | 参考价格 |
|---|---|---|---|---|
| gpu-standard-v1 | 1x A100 40GB | 8 | 48GB | 约$1.2/小时 |
| gpu-standard-v2 | 1x A100 80GB | 12 | 96GB | 约$1.8/小时 |
| gpu-standard-v3 | 2x A100 80GB | 24 | 192GB | 约$3.6/小时 |
| gpu-h100-v1 | 1x H100 80GB | 12 | 96GB | 约$2.5/小时 |
| gpu-h100-v2 | 8x H100 80GB | 96 | 768GB | 约$20/小时 |
通过 CLI 创建 GPU 实例
1
2
3
4
5 # 查看 GPU 可用区
yc compute zone list
# 创建 A100 GPU 实例(预装 CUDA 和 PyTorch)
yc compute instance create --name ai-gpu-a100 --zone eu-west1-b --platform gpu-standard-v1 --create-boot-disk image-folder-id=standard-images,image-family=ubuntu-2204-lts --network-interface subnet-name=default,nat-ip-version=ipv4 --preemptible --ssh-key ~/.ssh/id_rsa.pub
注意使用
1 | --preemptible |
参数可以大幅降低成本。抢占式实例的价格约为按需实例的 30%-50%,非常适合模型训练和批量推理任务。
通过 Terraform 管理基础设施
对于需要频繁创建和销毁 GPU 实例的用户,推荐使用 Terraform 进行基础设施即代码管理:
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44 # main.tf - Nebius GPU 实例
terraform {
required_providers {
yandex = {
source = "yandex-cloud/yandex"
}
}
}
provider "yandex" {
zone = "eu-west1-b"
}
resource "yandex_compute_instance" "gpu_a100" {
name = "ai-gpu-a100"
platform_id = "gpu-standard-v1"
zone = "eu-west1-b"
resources {
core = 8
memory = 48
gpus = 1
}
boot_disk {
initialize_params {
image_id = "ubuntu-2204-lts-gpu"
size = 100
}
}
network_interface {
subnet_id = yandex_vpc_subnet.default.id
nat = true
}
scheduling_policy {
preemptible = true
}
metadata = {
ssh-keys = "ubuntu:${file("~/.ssh/id_rsa.pub")}"
}
}

AI Studio:一键调用开源大模型推理
Nebius AI Studio 是其最具特色的服务之一,它提供了与 OpenAI API 兼容的接口,让你可以无缝切换到开源大模型,同时保持代码零改动。
支持的模型列表
AI Studio 当前支持多种主流开源模型的推理,包括但不限于:
- Meta Llama 3.1 (8B/70B/405B) — Meta 最新的开源旗舰模型
- Qwen 2.5 (7B/72B) — 阿里云通义千问最新版
- DeepSeek V3 / R1 — 国产深度推理模型
- Mistral Small/Medium/Large — 欧洲开源模型家族
- Codestral — Mistral 专为代码生成优化的模型
- SDXL / Flux — 文生图模型推理
API 调用示例
AI Studio 的 API 完全兼容 OpenAI 格式,你只需要更换 base_url 和 API key 即可:
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20 # Python SDK 调用示例
from openai import OpenAI
client = OpenAI(
base_url="https://studio.api.nebius.ai/v1",
api_key="your-nebius-api-key"
)
# 调用 Llama 3.1 70B
response = client.chat.completions.create(
model="meta-llama/Meta-Llama-3.1-70B-Instruct",
messages=[
{"role": "system", "content": "你是一个专业的AI助手。"},
{"role": "user", "content": "请解释Transformer注意力机制的原理。"}
],
temperature=0.7,
max_tokens=2048
)
print(response.choices[0].message.content)
使用 cURL 测试
1
2
3
4
5
6
7
8
9
10 curl -X POST https://studio.api.nebius.ai/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer *** \
-d '{
"model": "meta-llama/Meta-Llama-3.1-70B-Instruct",
"messages": [
{"role": "user", "content": "Write a Python function for merge sort"}
],
"max_tokens": 1024
}'
流式输出(Streaming)
1
2
3
4
5
6
7
8
9 stream = client.chat.completions.create(
model="Qwen/Qwen2.5-72B-Instruct",
messages=[{"role": "user", "content": "请用中文介绍量子计算的基本概念"}],
stream=True
)
for chunk in stream:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)

Cloud Functions:零成本部署 AI 服务
Nebius Cloud Functions 是其 Serverless 计算服务,每月 100 万次免费调用额度使其成为部署轻量级 AI 服务的理想选择。你可以用它来创建 AI 推理的 API 端点,无需管理任何服务器。
部署 AI 推理函数
以下是一个使用 Cloud Functions 代理 Nebius AI Studio 推理的完整示例:
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35 # handler.py - Cloud Function 入口
import json
import urllib.request
API_URL = "https://studio.api.nebius.ai/v1/chat/completions"
API_KEY = "your-nebius-api-key"
def handler(event, context):
# Cloud Function 处理函数
body = json.loads(event.get("body", "{}"))
user_message = body.get("message", "Hello")
model = body.get("model", "meta-llama/Meta-Llama-3.1-8B-Instruct")
payload = json.dumps({
"model": model,
"messages": [{"role": "user", "content": user_message}],
"max_tokens": 512
}).encode("utf-8")
req = urllib.request.Request(
API_URL,
data=payload,
headers={
"Content-Type": "application/json",
"Authorization": "Bearer " + API_KEY
}
)
try:
with urllib.request.urlopen(req, timeout=30) as resp:
result = json.loads(resp.read().decode("utf-8"))
reply = result["choices"][0]["message"]["content"]
return {"statusCode": 200, "body": json.dumps({"reply": reply})}
except Exception as e:
return {"statusCode": 500, "body": json.dumps({"error": str(e)})}
部署命令
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17 # 创建 Cloud Function
yc serverless function create --name ai-proxy
# 部署函数代码
yc serverless function version create \
--function-name ai-proxy \
--runtime python312 \
--entrypoint handler.handler \
--source-path ./handler.py \
--memory 256m \
--execution-timeout 30s
# 允许公开访问
yc serverless function allow-unauthenticated-invoke --function-name ai-proxy
# 获取调用 URL
yc serverless function get --name ai-proxy --format json
数据存储与模型管理
在 AI 开发工作流中,数据存储和模型版本管理是关键环节。Nebius 提供了完善的存储解决方案。
Object Storage(对象存储)
Nebius Object Storage 兼容 Amazon S3 API,你可以直接使用 boto3 进行操作:
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20 import boto3
# Nebius S3 兼容客户端
s3 = boto3.client(
"s3",
endpoint_url="https://storage.ai.nebius.cloud",
aws_access_key_id="your-access-key",
aws_secret_access_key="your-secret-key",
region_name="eu-west1"
)
# 上传训练数据
s3.upload_file("datasets/train_data.parquet", "my-ai-bucket", "data/train.parquet")
# 上传模型权重
s3.upload_file("models/my_model_v2.safetensors", "my-ai-bucket", "models/v2/weights.safetensors")
# 列出存储桶内容
for obj in s3.list_objects_v2(Bucket="my-ai-bucket")["Contents"]:
print(f"{obj['Key']}: {obj['Size']} bytes")
在 GPU 实例上挂载存储
训练模型时,你需要将数据从 Object Storage 挂载到 GPU 实例上:
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16 # 在 GPU 实例上安装 s3fs
sudo apt-get install -y s3fs
# 配置凭证
echo "ACCESS_KEY:SECRET_KEY" > ~/.passwd-s3fs
chmod 600 ~/.passwd-s3fs
# 挂载存储桶
mkdir -p /mnt/data
s3fs my-ai-bucket /mnt/data \
-o url=https://storage.ai.nebius.cloud \
-o passwd_file=~/.passwd-s3fs \
-o use_path_request_style
# 验证挂载
ls -la /mnt/data/
实际应用场景
以下是一些利用 Nebius 免费额度可以完成的实际项目:
场景一:微调开源大模型
使用 A100 GPU 实例和 LoRA 技术,你可以在几小时内完成一个 7B 参数模型的领域微调:
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41 # 安装依赖
pip install torch transformers peft accelerate datasets
# LoRA 微调脚本
from transformers import AutoModelForCausalLM, AutoTokenizer, TrainingArguments
from peft import LoraConfig, get_peft_model, TaskType
from datasets import load_dataset
from trl import SFTTrainer
model = AutoModelForCausalLM.from_pretrained(
"meta-llama/Meta-Llama-3.1-8B-Instruct",
load_in_4bit=True,
device_map="auto"
)
lora_config = LoraConfig(
task_type=TaskType.CAUSAL_LM,
r=16,
lora_alpha=32,
lora_dropout=0.05,
target_modules=["q_proj", "v_proj", "k_proj", "o_proj"]
)
model = get_peft_model(model, lora_config)
dataset = load_dataset("json", data_files="train_data.jsonl")
trainer = SFTTrainer(
model=model,
train_dataset=dataset["train"],
args=TrainingArguments(
output_dir="./lora-output",
num_train_epochs=3,
per_device_train_batch_size=4,
gradient_accumulation_steps=4,
learning_rate=2e-4,
fp16=True,
logging_steps=10,
),
)
trainer.train()
场景二:搭建 RAG 问答系统
结合 Nebius 的 GPU 算力和 AI Studio 推理能力,构建一个完整的 RAG 系统:
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28 import numpy as np
from openai import OpenAI
client = OpenAI(
base_url="https://studio.api.nebius.ai/v1",
api_key="your-nebius-api-key"
)
def get_embeddings(texts, model="BAAI/bge-large-en-v1.5"):
# 获取文本向量
response = client.embeddings.create(model=model, input=texts)
return [e.embedding for e in response.data]
def rag_query(query, knowledge_base, top_k=3):
# RAG 检索增强生成
query_emb = np.array(get_embeddings([query]))
kb_embs = np.array(get_embeddings(knowledge_base["texts"]))
scores = np.dot(kb_embs, query_emb.T).flatten()
top_indices = np.argsort(scores)[-top_k:][::-1]
context = "\n".join([knowledge_base["texts"][i] for i in top_indices])
response = client.chat.completions.create(
model="meta-llama/Meta-Llama-3.1-70B-Instruct",
messages=[
{"role": "system", "content": "基于以下上下文回答问题:\n" + context},
{"role": "user", "content": query}
]
)
return response.choices[0].message.content

成本优化技巧
为了最大化利用免费额度,以下是一些实用的成本优化建议:
1. 使用抢占式实例
抢占式(Preemptible)GPU 实例的价格仅为按需实例的 30%-50%。虽然可能被随时回收,但对于容错性强的训练任务来说,这个性价比极其划算。建议设置检查点(checkpoint),以便实例被回收后可以从上次保存的位置继续训练。
2. 选择合适的 GPU 规格
并非所有任务都需要 H100。对于推理和小模型微调,A100 40GB 已经完全足够。根据实际需求选择最经济的配置:
- 7B 模型推理/微调 — 1x A100 40GB
- 70B 模型推理 — 1x A100 80GB
- 70B 模型全参数微调 — 2x-4x A100 80GB
- 大规模分布式训练 — 8x H100 80GB
3. 及时释放闲置资源
1
2
3
4
5
6
7
8 # 查看运行中的实例
yc compute instance list --format json | jq '.[] | select(.status=="RUNNING")'
# 停止不需要的实例(停止后不再计费 GPU 费用)
yc compute instance stop ai-gpu-a100
# 完全删除不再使用的实例
yc compute instance delete ai-gpu-a100
4. 设置使用量告警
在 Nebius 控制台中设置预算告警,当消费达到设定阈值时自动通知。你也可以通过 API 编写定时检查脚本,在空闲时段自动停止实例,避免忘记关机导致额度浪费:
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15 import json
import urllib.request
def check_usage(budget_limit=100):
# 检查当前消费并告警
req = urllib.request.Request(
"https://billing.ai.nebius.cloud/v1/balance",
headers={"Authorization": "Bearer your-token"}
)
with urllib.request.urlopen(req, timeout=10) as resp:
data = json.loads(resp.read())
spent = data.get("balance", 0)
if spent >= budget_limit * 0.8:
print("WARNING: 已使用预算的80%以上!")
return spent
与其他免费算力平台的对比
为了帮助你做出最优选择,下面将 Nebius 与其他主流免费 AI 算力平台进行对比:
| 平台 | 免费额度 | GPU 类型 | 有效期 | 绑定信用卡 |
|---|---|---|---|---|
| Nebius | $5,000 赠金 | A100/H100 | 60天 | 可选 |
| Google Colab | 免费 GPU (T4) | T4/V100 | 永久(有限) | 否 |
| Kaggle | 30h/周 GPU | T4/P100 | 永久(有限) | 否 |
| Lightning AI | 22 GPU 小时/月 | T4/A10G | 永久(有限) | 否 |
| Modal | $30/月 | T4/A100 | 永久(有限) | 否 |
| AWS | $200 赠金 | 多种 | 12个月 | 是 |
| Azure | $200 赠金 | 多种 | 30天 | 是 |
| Google Cloud | $300 赠金 | 多种 | 90天 | 是 |
从对比可以看出,Nebius 在赠金金额上远超其他平台,且提供业界顶级的 A100/H100 GPU。唯一的限制是 60 天的有效期,但在这个时间窗口内,你可以完成相当多的 AI 项目开发。
注意事项与常见问题
账户安全
- 定期检查账单面板,确保资源消耗在预期范围内
- 为服务账户设置最小权限原则,避免意外操作
- 启用双因素认证保护你的账户安全
资源限制
- GPU 实例有区域限制,部分高级 GPU 可能只在特定区域可用
- 抢占式实例可能因资源紧张而无法创建,建议在非高峰时段尝试
- 免费赠金用完后,如果未绑定支付方式,实例将自动停止
常见问题
Q: $5,000 赠金用完后会自动扣费吗?
A: 不会。如果你没有绑定支付方式,额度用完后服务会停止,不会产生额外费用。绑定支付方式前请确认你的预算。
Q: 可以创建多个账户获取多份赠金吗?
A: Nebius 的服务条款禁止多账户滥用赠金。建议合规使用,专注于在一个账户内最大化价值。
Q: 抢占式实例被回收后数据会丢失吗?
A: 磁盘数据不会随实例回收而丢失(除非你删除了磁盘)。但内存中的数据会丢失,因此务必设置训练检查点并保存到持久存储。
总结
Nebius AI Cloud 凭借其 $5,000 的新用户赠金、业界顶级的 A100/H100 GPU 资源、兼容 OpenAI API 的 AI Studio 推理服务以及永久免费的 Cloud Functions 层级,成为目前最具吸引力的免费 AI 算力平台之一。
对于想要在零成本条件下体验高端 GPU 算力的开发者,Nebius 提供了一个难得的机会。无论你是想微调开源大模型、搭建 RAG 系统、还是部署 AI 推理 API,Nebius 的免费额度都足以支撑你完成从概念验证到原型的全流程开发。
关键建议:合理规划 60 天的赠金使用窗口,优先完成最核心的 AI 项目,使用抢占式实例降低成本,设置预算告警防止资源浪费。把握住这个机会,让你的 AI 项目在顶级算力上起飞!
汤不热吧