{/* Trang này được tạo tự động từ SKILL.md của kỹ năng bởi website/scripts/generate-skill-docs.py. Chỉnh sửa nguồn SKILL.md, không phải trang này. */}
Đám mây Gpu của Phòng thí nghiệm Lambda
Các phiên bản đám mây GPU dành riêng và theo yêu cầu để đào tạo và suy luận ML. Sử dụng khi bạn cần các phiên bản GPU chuyên dụng có khả năng truy cập SSH đơn giản, hệ thống tệp ổn định hoặc cụm nhiều nút hiệu suất cao để đào tạo trên quy mô lớn.
Siêu dữ liệu kỹ năng
| Nguồn | Tùy chọn — cài đặt với |
| `Hermes skills install official/mlops/lambda-labs | |
| ` | |
| Đường dẫn |
optional-skills/mlops/lambda-labs ` | | Phiên bản |
1.0.0 ` | | Tác giả | Nghiên cứu dàn nhạc | | Giấy phép | MIT | | Phụ thuộc |
lambda-cloud-CLIent>=1.0.0 ` | | Nền tảng | Linux, macOS, Windows | | Thẻ |
Infrastructure
, `GPU Cloud
, `Training
, `Inference
,
Lambda Labs |
Tham khảo: đầy đủ SKILL.md
Sau đây là định nghĩa kỹ năng đầy đủ mà Hermes tải khi kỹ năng này được kích hoạt. Đây là những gì tác nhân coi là hướng dẫn khi kỹ năng được kích hoạt.
Đám mây GPU của Phòng thí nghiệm Lambda
Hướng dẫn toàn diện về cách chạy khối lượng công việc ML trên đám mây GPU Lambda Labs với các phiên bản theo yêu cầu và Cụm 1 cú nhấp chuột.
Khi nào nên sử dụng Phòng thí nghiệm Lambda`Sử dụng Lambda Labs khi:
- Cần các phiên bản GPU chuyên dụng có quyền truy cập SSH đầy đủ
- Chạy các công việc đào tạo dài (hàng giờ đến hàng ngày)
- Muốn định giá đơn giản mà không có phí đầu ra
- Cần lưu trữ liên tục qua các phiên
- Yêu cầu cụm nhiều nút hiệu suất cao (GPU 16-512)
- Muốn cài đặt sẵn ML stack (Lambda Stack with PyTorch, CUDA, NCCL)
Các tính năng chính:
- GPU đa dạng: B200, H100, GH200, A100, A10, A6000, V100
- Lambda Stack: PyTorch, TensorFlow, CUDA, cuDNN, NCCL được cài đặt sẵn
- Hệ thống tệp liên tục: Giữ dữ liệu trong quá trình khởi động lại phiên bản
- Cụm 1 lần nhấp: Cụm GPU Slurm 16-512 với InfiniBand
- Định giá đơn giản: Trả tiền theo phút, không tính phí ra
- Khu vực toàn cầu: Hơn 12 khu vực trên toàn thế giới`Sử dụng các lựa chọn thay thế thay thế:
- Phương thức: Dành cho khối lượng công việc không có máy chủ, tự động mở rộng quy mô
- SkyPilot: Để điều phối nhiều đám mây và tối ưu hóa chi phí
- RunPod: Dành cho các phiên bản giao ngay rẻ hơn và điểm cuối không có máy chủ
- Vast.ai: Dành cho thị trường GPU có giá thấp nhất
Bắt đầu nhanh
Thiết lập tài khoản
- Tạo tài khoản tại https://lambda.ai
- Thêm phương thức thanh toán
- Tạo khóa API từ bảng điều khiển
- Thêm khóa SSH (bắt buộc trước khi khởi chạy phiên bản)
Khởi chạy qua bảng điều khiển
- Truy cập https://cloud.lambda.ai/instances
- Nhấp vào "Khởi chạy phiên bản"
- Chọn loại và vùng GPU
- Chọn khóa SSH
- Tùy chọn đính kèm hệ thống tập tin
- Khởi chạy và đợi 3-15 phút
Kết nối qua SSH
# Get instance IP from console
SSH ubuntu@<INSTANCE-IP
# Or with specific key
SSH -i ~/.SSH/lambda_key ubuntu@<INSTANCE-IP
`
## phiên bản GPU
### GPU có sẵn
| GPU | VRAM | Giá/GPU/giờ | Tốt nhất cho |
|------|------|--------------|----------|
| B200 SXM6 | 180 GB | 4,99 USD | Mô hình lớn nhất, đào tạo nhanh nhất |
| H100 SXM | 80GB | $2,99-3,29 | Đào tạo mô hình lớn |
| H100 PCIe | 80GB | 2,49 USD | H100 tiết kiệm chi phí |
| GH200 | 96GB | $1,49 | Các model lớn GPU đơn |
| A100 80GB | 80 GB | $1,79 | Đào tạo sản xuất |
| A100 40GB | 40 GB | $1,29 | Đào tạo tiêu chuẩn |
| A10 | 24GB | 0,75 USD | Suy luận, tinh chỉnh |
| A6000 | 48 GB | $0,80 | Tỷ lệ VRAM/giá tốt |
| V100 | 16GB | 0,55 USD | Đào tạo ngân sách |
### Cấu hình phiên bản
`
8x GPU: Best for distributed training (DDP, FSDP)
4x GPU: Large models, multi-GPU training
2x GPU: Medium workloads
1x GPU: Fine-tuning, inference, development
`
### Thời gian ra mắt
- GPU đơn: 3-5 phút
- Đa GPU: 10-15 phút
## Ngăn xếp Lambda
Tất cả các phiên bản đều được cài đặt sẵn Lambda Stack:
``` bash
# Included software
- Ubuntu 22.04 LTS
- NVIDIA drivers (latest)
- CUDA 12.x
- cuDNN 8.x
- NCCL (for multi-GPU)
- PyTorch (latest)
- TensorFlow (latest)
- JAX
- JupyterLab
`
### Xác minh cài đặt
``` bash
# Check GPU
nvidia-smi
# Check PyTorch
Python -c "import torch; print(torch.cuda.is_available())"
# Check CUDA version
nvcc --version
`
## API Python
### Cài đặt
``` bash
pip install lambda-cloud-CLIent
`
### Xác thực
`Python
import os
import lambda_cloud_CLIent
# Configure with API key
configuration = lambda_cloud_CLIent.Configuration(
host="https://cloud.lambdalabs.com/API/v1",
access_token=os.environ["LAMBDA_API_KEY"]
)
`
### Liệt kê các phiên bản có sẵn
`Python
with lambda_cloud_CLIent.APICLIent(configuration) as API_CLIent:
API = lambda_cloud_CLIent.DefaultAPI(API_CLIent)
# Get available instance types
types = API.instance_types()
for name, info in types.data.items():
print(f"\{name}: \{info.instance_type.description}")
`
### Khởi chạy phiên bản
`Python
from lambda_cloud_CLIent.models import LaunchInstanceRequest`request = LaunchInstanceRequest(
region_name="us-west-1",
instance_type_name="gpu_1x_h100_sxm5",
SSH_key_names=["my-SSH-key"],
file_system_names=["my-filesystem"], # Optional
name="training-job"
)
response = API.launch_instance(request)
instance_id = response.data.instance_ids[0]
print(f"Launched: \{instance_id}")
`
### Liệt kê các instance đang chạy
`Python
instances = API.list_instances()
for instance in instances.data:
print(f"\{instance.name}: \{instance.ip} (\{instance.status})")
`
### Chấm dứt phiên bản
`Python
from lambda_cloud_CLIent.models import TerminateInstanceRequest`request = TerminateInstanceRequest(
instance_ids=[instance_id]
)
API.terminate_instance(request)
`
### Quản lý khóa SSH
`Python
from lambda_cloud_CLIent.models import AddSSHKeyRequest
# Add SSH key
request = AddSSHKeyRequest(
name="my-key",
public_key="SSH-rsa AAAA..."
)
API.add_SSH_key(request)
# List keys
keys = API.list_SSH_keys()
# Delete key
API.delete_SSH_key(key_id)
`
## CLI có độ cong
### Liệt kê các loại phiên bản
`bash
curl -u $LAMBDA_API_KEY: \
https://cloud.lambdalabs.com/API/v1/instance-types | jq
`
### Khởi chạy phiên bản
`bash
curl -u $LAMBDA_API_KEY: \
-X POST https://cloud.lambdalabs.com/API/v1/instance-operations/launch \
-H "Content-Type: application/JSON" \
-d '{
"region_name": "us-west-1",
"instance_type_name": "gpu_1x_h100_sxm5",
"SSH_key_names": ["my-key"]
}' | jq
`
### Chấm dứt phiên bản
``` bash
curl -u $LAMBDA_API_KEY: \
-X POST https://cloud.lambdalabs.com/API/v1/instance-operations/terminate \
-H "Content-Type: application/JSON" \
-d '\{"instance_ids": ["<INSTANCE-ID"]}' | jq
`
## Lưu trữ liên tục
### Hệ thống tập tin
Hệ thống tập tin duy trì dữ liệu trong quá trình khởi động lại phiên bản:
``` bash
# Mount location
/lambda/nfs/<FILESYSTEM_NAME
# Example: save checkpoints
Python train.py --checkpoint-dir /lambda/nfs/my-storage/checkpoints
`
### Tạo hệ thống tập tin
1. Đi tới Bộ nhớ trong bảng điều khiển Lambda
2. Nhấp vào "Tạo hệ thống tập tin"
3. Chọn vùng (phải khớp với vùng phiên bản)
4. Đặt tên và tạo
### Đính kèm vào phiên bản
Hệ thống tập tin phải được đính kèm tại thời điểm khởi chạy phiên bản:
- Qua console: Chọn hệ thống tập tin khi khởi chạy
- Qua API: Bao gồm
`file_system_names
` trong yêu cầu khởi chạy
### Các phương pháp hay nhất<!-- ascii-guard-ignore -->
`
``` bash
# Store on filesystem (persists)
/lambda/nfs/storage/
├── datasets/
├── checkpoints/
├── models/
└── outputs/
# Local SSD (faster, ephemeral)
/home/ubuntu/
└── working/ # Temporary files
`
<!-- ascii-guard-ignore-end -->
## Cấu hình SSH
### Thêm khóa SSH
``` bash
# Generate key locally
SSH-keygen -t ed25519 -f ~/.SSH/lambda_key
# Add public key to Lambda console
# Or via API
`
### Nhiều phím
``` bash
# On instance, add more keys
echo 'SSH-rsa AAAA...' >> ~/.SSH/authoriZed_keys
`
### Nhập từ GitHub
``` bash
# On instance
SSH-import-id gh:username
`
### Đường hầm SSH
``` bash
# Forward Jupyter
SSH -L 8888:localhost:8888 ubuntu@<IP
# Forward TensorBoard
SSH -L 6006:localhost:6006 ubuntu@<IP
# Multiple ports
SSH -L 8888:localhost:8888 -L 6006:localhost:6006 ubuntu@<IP
`
## JupyterLab
### Khởi chạy từ bảng điều khiển
1. Đi đến trang Phiên bản
2. Nhấp vào "Khởi chạy" trong cột Cloud IDE
3. JupyterLab mở trong trình duyệt
### Truy cập thủ công
``` bash
# On instance
jupyter lab --ip=0.0.0.0 --port=8888
# From local machine with tunnel
SSH -L 8888:localhost:8888 ubuntu@<IP
# Open http://localhost:8888
`
## Quy trình đào tạo
### Đào tạo GPU đơn
``` bash
# SSH to instance
SSH ubuntu@<IP
# Clone repo
git clone https://GitHub.com/user/project
cd project
# Install dependencies
pip install -r requirements.txt
# Train
Python train.py --epochs 100 --checkpoint-dir /lambda/nfs/storage/checkpoints
`
### Đào tạo đa GPU (nút đơn)
``` python
# train_ddp.py
import torch
import torch.distributed as dist
from torch.nn.parallel import DistributedDataParallel as DDP`def main():
dist.init_process_group("nccl")
rank = dist.get_rank()
device = rank % torch.cuda.device_count()
model = MyModel().to(device)
model = DDP(model, device_ids=[device])
# Training loop...
if __name__ == "__main__":
main()
`
`
``` bash
# Launch with torchrun (8 GPUs)
torchrun --nproc_per_node=8 train_ddp.py
`
### Điểm kiểm tra hệ thống tập tin
``` python
import os`checkpoint_dir = "/lambda/nfs/my-storage/checkpoints"
os.makedirs(checkpoint_dir, exist_ok=True)
# Save checkpoint
torch.save({
'epoch': epoch,
'model_state_dict': model.state_dict(),
'optimizer_state_dict': optimizer.state_dict(),
'loss': loss,
}, f"\{checkpoint_dir}/checkpoint_\{epoch}.pt")
`
## Cụm 1 lần nhấp chuột
### Tổng quan
Cụm Slurm hiệu suất cao với:
- GPU NVIDIA H100 hoặc B200 16-512
- NVIDIA Quantum-2 400 Gb/s InfiniBand
- GPUDirect RDMA ở tốc độ 3200 Gb/s
- Ngăn xếp ML phân tán được cài đặt sẵn`###Phần mềm đi kèm
- Ubuntu 22.04 LTS + Ngăn xếp Lambda
- NCCL, MPI mở
- PyTorch với DDP và FSDP
- TenorFlow
- Trình điều khiển OFED
### Lưu trữ
- 24 TB NVMe cho mỗi nút điện toán (tạm thời)
- Hệ thống tập tin Lambda cho dữ liệu liên tục
### Đào tạo nhiều nút
``` bash
# On Slurm cluster
srun --nodes=4 --ntasks-per-node=8 --gpus-per-node=8 \
torchrun --nnodes=4 --nproc_per_node=8 \
--rdzv_backend=c10d --rdzv_endpoint=$MASTER_ADDR:29500 \
train.py
`
## Kết nối mạng
### Băng thông
- Liên phiên bản (cùng khu vực): lên tới 200 Gbps
- Internet đi: tối đa 20 Gbps
### Tường lửa
- Mặc định: Chỉ mở port 22 (SSH)
- Định cấu hình các cổng bổ sung trong bảng điều khiển Lambda
- Lưu lượng ICMP được phép theo mặc định
### IP riêng
``` bash
# Find private IP
ip addr show | grep 'inet '
`
## Quy trình công việc chung
### Quy trình 1: Tinh chỉnh LLM
``` bash
# 1. Launch 8x H100 instance with filesystem
# 2. SSH and setup
SSH ubuntu@<IP
pip install transformers accelerate peft
# 3. Download model to filesystem
Python -c "
from transformers import AutoModelForCausaLLM
model = AutoModelForCausaLLM.from_pretrained('meta-Llama/Llama-2-7b-hf')
model.save_pretrained('/lambda/nfs/storage/models/Llama-2-7b')
"
# 4. Fine-tune with checkpoints on filesystem
accelerate launch --num_processes 8 train.py \
--model_path /lambda/nfs/storage/models/Llama-2-7b \
--output_dir /lambda/nfs/storage/outputs \
--checkpoint_dir /lambda/nfs/storage/checkpoints
`
### Luồng công việc 2: Suy luận hàng loạt
``` bash
# 1. Launch A10 instance (cost-effective for inference)
# 2. Run inference
Python inference.py \
--model /lambda/nfs/storage/models/fine-tuned \
--input /lambda/nfs/storage/data/inputs.JSONl \
--output /lambda/nfs/storage/data/outputs.JSONl
`
``##Tối ưu hóa chi phí
### Chọn GPU phù hợp
| Nhiệm vụ | GPU được đề xuất |
|------|-------------------|
| Tinh chỉnh LLM (7B) | A100 40GB |
| Tinh chỉnh LLM (70B) | 8x H100 |
| Suy luận | A10, A6000 |
| Phát triển | V100, A10 |
| Hiệu suất tối đa | B200 |
###Giảm chi phí
1. **Sử dụng hệ thống tập tin**: Tránh tải lại dữ liệu xuống
2. **Kiểm tra thường xuyên**: Tiếp tục quá trình đào tạo bị gián đoạn
3. **Kích thước phù hợp**: Không cung cấp quá nhiều GPU
4. **Chấm dứt khi không hoạt động**: Không tự động dừng, chấm dứt thủ công
### Giám sát việc sử dụng
- Bảng điều khiển hiển thị việc sử dụng GPU theo thời gian thực
- API để theo dõi theo chương trình
## Các vấn đề thường gặp
| Vấn đề | Giải pháp |
|-------|----------|
| Phiên bản sẽ không khởi chạy | Kiểm tra tính khả dụng của khu vực, thử GPU khác nhau |
| Kết nối SSH bị từ chối | Đợi phiên bản khởi tạo (3-15 phút) |
| Dữ liệu bị mất sau khi chấm dứt | Sử dụng hệ thống tập tin liên tục |
| Truyền dữ liệu chậm | Sử dụng hệ thống tập tin trong cùng khu vực |
| GPU không được phát hiện | Khởi động lại phiên bản, kiểm tra trình điều khiển |
## Tài liệu tham khảo
- **[Advanced Usage](https://GitHub.com/NousResearch/Hermes-agent/blob/main/optional-skills/mlops/lambda-labs/references/advanced-usage.md)** - Đào tạo đa nút, tự động hóa API
- **[Troubleshooting](https://GitHub.com/NousResearch/Hermes-agent/blob/main/optional-skills/mlops/lambda-labs/references/troubleshooting.md)** - Các vấn đề thường gặp và giải pháp
## Tài nguyên
- **Tài liệu**: https://docs.lambda.ai
- **Bảng điều khiển**: https://cloud.lambda.ai
- **Giá**: https://lambda.ai/instances
- **Hỗ trợ**: https://support.lambdalabs.com
- **Blog**: https://lambda.ai/blog