{/* Trang này được tạo tự động từ SKILL.md của kỹ năng bởi website/scripts/generate-skill-docs.py. Chỉnh sửa nguồn SKILL.md, không phải trang này. */}
Tensort LLM
Tối ưu hóa suy luận LLM với NVIDIA TensorRT để có thông lượng tối đa và độ trễ thấp nhất. Sử dụng để triển khai sản xuất trên GPU NVIDIA (A100/H100), khi bạn cần suy luận nhanh hơn 10-100 lần so với PyTorch hoặc để phục vụ các mô hình có lượng tử hóa (FP8/INT4), phân khối trong chuyến bay và chia tỷ lệ nhiều GPU.
Siêu dữ liệu kỹ năng
| Nguồn | Tùy chọn — cài đặt với |
| `Hermes skills install official/mlops/tensorrt-LLM | |
| ` | |
| Đường dẫn |
optional-skills/mlops/tensorrt-LLM ` | | Phiên bản |
1.0.0 ` | | Tác giả | Nghiên cứu dàn nhạc | | Giấy phép | MIT | | Phụ thuộc |
tensorrt-LLM
,
torch |
| Nền tảng | Linux, macOS |
| Thẻ |
Inference Serving
, `TensorRT-LLM
, `NVIDIA
, `Inference Optimization
, `High Throughput
, `Low Latency
, `Production
, `FP8
, `INT4
, `In-Flight Batching
,
Multi-GPU |
Tham khảo: đầy đủ SKILL.md
Sau đây là định nghĩa kỹ năng đầy đủ mà Hermes tải khi kỹ năng này được kích hoạt. Đây là những gì tác nhân coi là hướng dẫn khi kỹ năng được kích hoạt.
TensorRT-LLM
Thư viện mã nguồn mở của NVIDIA để tối ưu hóa suy luận LLM với hiệu năng tiên tiến trên GPU NVIDIA.
Khi nào nên sử dụng TensorRT-LLM`Sử dụng TensorRT-LLM khi:
- Triển khai trên GPU NVIDIA (A100, H100, GB200)
- Cần thông lượng tối đa (24.000+ token/giây trên Llama 3)
- Yêu cầu độ trễ thấp cho các ứng dụng thời gian thực
- Làm việc với các mô hình lượng tử hóa (FP8, INT4, FP4)
- Mở rộng quy mô trên nhiều GPU hoặc nút`Sử dụng vLLM thay thế khi:
- Cần thiết lập đơn giản hơn và API đầu tiên của Python
- Muốn PagedAttention mà không cần biên dịch TensorRT
- Làm việc với GPU AMD hoặc phần cứng không phải NVIDIA`Sử dụng Llama.cpp thay thế khi:
- Triển khai trên CPU hoặc Apple Silicon
- Cần triển khai biên mà không cần GPU NVIDIA
- Muốn định dạng lượng tử hóa GGUF đơn giản hơn
Bắt đầu nhanh
Cài đặt
# Docker (recommended)
Docker pull nvidia/tensorrt_LLM:latest
# pip install
pip install tensorrt_LLM==1.2.0rc3
# Requires CUDA 13.0.0, TensorRT 10.13.2, Python 3.10-3.12
`
### Suy luận cơ bản
``` python
from tensorrt_LLM import LLM, SamplingParams
# Initialize model
LLM = LLM(model="meta-Llama/Meta-Llama-3-8B")
# Configure sampling
sampling_params = SamplingParams(
max_tokens=100,
temperature=0.7,
top_p=0.9
)
# Generate
prompts = ["Explain quantum computing"]
outputs = LLM.generate(prompts, sampling_params)
for output in outputs:
print(output.text)
`
### Phục vụ bằng trtLLM-serve
`bash
# Start server (automatic model download and compilation)
trtLLM-serve meta-Llama/Meta-Llama-3-8B \
--tp_size 4 \ # Tensor parallelism (4 GPUs)
--max_batch_size 256 \
--max_num_tokens 4096
# CLIent request
curl -X POST http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/JSON" \
-d '{
"model": "meta-Llama/Meta-Llama-3-8B",
"messages": [\{"role": "user", "content": "Hello!"}],
"temperature": 0.7,
"max_tokens": 100
}'
`
## Các tính năng chính
### Tối ưu hóa hiệu suất
- **Phân khối trong chuyến bay**: Phân khối động trong quá trình tạo
- **Bộ đệm KV phân trang**: Quản lý bộ nhớ hiệu quả
- **Chú ý chớp nhoáng**: Hạt nhân chú ý được tối ưu hóa
- **Lượng tử hóa**: FP8, INT4, FP4 cho khả năng suy luận nhanh hơn 2-4×
- **Biểu đồ CUDA**: Giảm chi phí khởi chạy kernel
### Tính song song
- **Song song Tensor (TP)**: Phân chia mô hình trên các GPU
- **Song song đường ống (PP)**: Phân phối theo lớp
- **Chuyên gia song song**: Dành cho mô hình Hỗn hợp các chuyên gia
- **Đa nút**: Mở rộng ra ngoài máy đơn lẻ
### Tính năng nâng cao
- **Giải mã suy đoán**: Tạo nhanh hơn với các mô hình nháp
- **Phục vụ LoRA**: Triển khai nhiều bộ chuyển đổi hiệu quả
- **Phân phối phân tách**: Điền trước và tạo riêng biệt
## Các mẫu phổ biến
### Mô hình lượng tử hóa (FP8)
``` python
from tensorrt_LLM import LLM
# Load FP8 quantiZed model (2× faster, 50% memory)
LLM = LLM(
model="meta-Llama/Meta-Llama-3-70B",
dtype="fp8",
max_num_tokens=8192
)
# Inference same as before
outputs = LLM.generate(["Summarize this article..."])
`
### Triển khai đa GPU
`Python
# Tensor parallelism across 8 GPUs
LLM = LLM(
model="meta-Llama/Meta-Llama-3-405B",
tensor_parallel_size=8,
dtype="fp8"
)
`
### Suy luận hàng loạt
``` python
# Process 100 prompts efficiently
prompts = [f"Question \{i}: ..." for i in range(100)]
outputs = LLM.generate(
prompts,
sampling_params=SamplingParams(max_tokens=200)
)
# Automatic in-flight batching for maximum throughput
`
## Điểm chuẩn hiệu suất`**Meta Llama 3-8B** (GPU H100):
- Thông lượng: 24.000 token/giây
- Độ trễ: ~10ms mỗi mã thông báo
- so với PyTorch: **nhanh hơn 100×**`**Llama 3-70B** (8× A100 80GB):
- Lượng tử hóa FP8: nhanh hơn 2× so với FP16
- Bộ nhớ: Giảm 50% với FP8
## Các mẫu được hỗ trợ
- **Gia đình Llama**: Llama 2, Llama 3, CodeLlama
- **Dòng GPT**: GPT-2, GPT-J, GPT-NeoX
- **Qwen**: Qwen, Qwen2, QwQ
- **DeepSeek**: DeepSeek-V2, DeepSeek-V3
- **Hỗn hợp**: Mixtral-8x7B, Mixtral-8x22B
- **Tầm nhìn**: LLaVA, Phi-3-vision
- **Hơn 100 mẫu** trên HuggingFace
## Tài liệu tham khảo
- **[Optimization Guide](https://GitHub.com/NousResearch/Hermes-agent/blob/main/optional-skills/mlops/tensorrt-LLM/references/optimization.md)** - Lượng tử hóa, phân khối, điều chỉnh bộ đệm KV
- **[Multi-GPU Setup](https://GitHub.com/NousResearch/Hermes-agent/blob/main/optional-skills/mlops/tensorrt-LLM/references/multi-gpu.md)** - Song song tensor/pipeline, nhiều nút
- **[Serving Guide](https://GitHub.com/NousResearch/Hermes-agent/blob/main/optional-skills/mlops/tensorrt-LLM/references/serving.md)** - Triển khai sản xuất, giám sát, tự động điều chỉnh quy mô
## Tài nguyên
- **Tài liệu**: https://nvidia.GitHub.io/TensorRT-LLM/
- **GitHub**: https://GitHub.com/NVIDIA/TensorRT-LLM
- **Người mẫu**: https://huggingface.co/models?library=tensorrt_LLM