Chuyển tới nội dung chính

{/* Trang này được tạo tự động từ SKILL.md của kỹ năng bởi website/scripts/generate-skill-docs.py. Chỉnh sửa nguồn SKILL.md, không phải trang này. */}

thì thầm

Mô hình nhận dạng giọng nói đa năng của OpenAI. Hỗ trợ 99 ngôn ngữ, phiên âm, dịch sang tiếng Anh và nhận dạng ngôn ngữ. Sáu kích thước mô hình từ nhỏ (thông số 39M) đến lớn (thông số 1550M). Sử dụng để chuyển giọng nói thành văn bản, phiên âm podcast hoặc xử lý âm thanh đa ngôn ngữ. Tốt nhất cho ASR mạnh mẽ, đa ngôn ngữ.

Siêu dữ liệu kỹ năng

NguồnTùy chọn — cài đặt với
`Hermes skills install official/mlops/whisper
`
Đường dẫn

optional-skills/mlops/whisper ` | | Phiên bản |

1.0.0 ` | | Tác giả | Nghiên cứu dàn nhạc | | Giấy phép | MIT | | Phụ thuộc |

OpenAI-whisper

, `transformers

, torch | | Nền tảng | Linux, macOS | | Thẻ |

Whisper

, `Speech Recognition

, `ASR

, `Multimodal

, `Multilingual

, `OpenAI

, `Speech-To-Text

, `Transcription

, `Translation

, Audio Processing |

Tham khảo: đầy đủ SKILL.md

thông tin

Sau đây là định nghĩa kỹ năng đầy đủ mà Hermes tải khi kỹ năng này được kích hoạt. Đây là những gì tác nhân coi là hướng dẫn khi kỹ năng được kích hoạt.

Whisper - Nhận dạng giọng nói mạnh mẽ

Mô hình nhận dạng giọng nói đa ngôn ngữ của OpenAI.

Khi nào nên sử dụng Whisper`Sử dụng khi:

  • Phiên âm lời nói thành văn bản (99 ngôn ngữ)
  • Phiên âm podcast/video
  • Tự động hóa ghi chú cuộc họp
  • Dịch sang tiếng Anh
  • Phiên âm âm thanh ồn ào
  • Xử lý âm thanh đa ngôn ngữ`Số liệu:
  • 72.900+ sao GitHub
  • Hỗ trợ 99 ngôn ngữ
  • Được đào tạo trên 680.000 giờ âm thanh
  • Giấy phép MIT`Thay vào đó hãy sử dụng các lựa chọn thay thế:
  • AssemblyAI: API được quản lý, ghi nhật ký người phát biểu
  • Deepgram: ASR phát trực tuyến theo thời gian thực
  • Chuyển giọng nói thành văn bản của Google: Dựa trên đám mây

Bắt đầu nhanh

Cài đặt


# Requires Python 3.8-3.11
pip install -U OpenAI-whisper

# Requires ffmpeg
# macOS: brew install ffmpeg
# Ubuntu: sudo apt install ffmpeg
# Windows: choco install ffmpeg

`

### Phiên âm cơ bản

``` python
import whisper

# Load model
model = whisper.load_model("base")

# Transcribe
result = model.transcribe("audio.mp3")

# Print text
print(result["text"])

# Access segments
for segment in result["segments"]:
print(f"[\{segment['start']:.2f}s - \{segment['end']:.2f}s] \{segment['text']}")

`

## Kích thước mô hình

`Python

# Available models
models = ["tiny", "base", "small", "medium", "large", "turbo"]

# Load specific model
model = whisper.load_model("turbo") # Fastest, good quality

`

| Người mẫu | Thông số | chỉ có tiếng Anh | Đa ngôn ngữ | Tốc độ | VRAM |
|-------|----------|--------------|--------------|-------|------|
| nhỏ bé | 39 triệu ||| ~32x | ~1 GB |
| căn cứ | 74 triệu ||| ~16x | ~1 GB |
| nhỏ | 244M ||| ~6x | ~2 GB |
| trung bình | 769 triệu ||| ~2x | ~5 GB |
| lớn | 1550M ||| 1x | ~10GB |
| tăng áp | 809 triệu ||| ~8x | ~6 GB |

**Khuyến nghị**: Sử dụng
`turbo
` để có tốc độ/chất lượng tốt nhất,
`base
` để tạo mẫu

## Tùy chọn phiên âm

### Đặc tả ngôn ngữ

``` python

# Auto-detect language
result = model.transcribe("audio.mp3")

# Specify language (faster)
result = model.transcribe("audio.mp3", language="en")

# Supported: en, es, fr, de, it, pt, ru, ja, ko, zh, and 89 more

`

### Lựa chọn nhiệm vụ

``` python

# Transcription (default)
result = model.transcribe("audio.mp3", task="transcribe")

# Translation to English
result = model.transcribe("spanish.mp3", task="translate")
# Input: Spanish audio → Output: English text

`

### Lời nhắc ban đầu

``` python

# Improve accuracy with context
result = model.transcribe(
"audio.mp3",
initial_prompt="This is a technical podcast about machine learning and AI."
)

# Helps with:
# - Technical terms
# - Proper nouns
# - Domain-specific vocabulary

`

### Dấu thời gian

``` python

# Word-level timestamps
result = model.transcribe("audio.mp3", word_timestamps=True)

for segment in result["segments"]:
for word in segment["words"]:
print(f"\{word['word']} (\{word['start']:.2f}s - \{word['end']:.2f}s)")

`

### Dự phòng nhiệt độ

``` python

# Retry with different temperatures if confidence low
result = model.transcribe(
"audio.mp3",
temperature=(0.0, 0.2, 0.4, 0.6, 0.8, 1.0)
)

`

## Cách sử dụng dòng lệnh

``` bash

# Basic transcription
whisper audio.mp3

# Specify model
whisper audio.mp3 --model turbo

# Output formats
whisper audio.mp3 --output_format txt # Plain text
whisper audio.mp3 --output_format srt # Subtitles
whisper audio.mp3 --output_format vtt # WebVTT
whisper audio.mp3 --output_format JSON # JSON with timestamps

# Language
whisper audio.mp3 --language Spanish

# Translation
whisper spanish.mp3 --task translate

`

## Xử lý hàng loạt

``` python
import os`audio_files = ["file1.mp3", "file2.mp3", "file3.mp3"]

for audio_file in audio_files:
print(f"Transcribing \{audio_file}...")
result = model.transcribe(audio_file)

# Save to file
output_file = audio_file.replace(".mp3", ".txt")
with open(output_file, "w") as f:
f.write(result["text"])

`

## Phiên âm thời gian thực

`Python

# For streaming audio, use faster-whisper
# pip install faster-whisper`from faster_whisper import WhisperModel`model = WhisperModel("base", device="cuda", compute_type="float16")

# Transcribe with streaming
segments, info = model.transcribe("audio.mp3", beam_size=5)

for segment in segments:
print(f"[\{segment.start:.2f}s -> \{segment.end:.2f}s] \{segment.text}")

`

## Tăng tốc GPU

``` python
import whisper

# Automatically uses GPU if available
model = whisper.load_model("turbo")

# Force CPU
model = whisper.load_model("turbo", device="cpu")

# Force GPU
model = whisper.load_model("turbo", device="cuda")

# 10-20× faster on GPU

`

## Tích hợp với các công cụ khác

### Tạo phụ đề

`bash

# Generate SRT subtitles
whisper video.mp4 --output_format srt --language English

# Output: video.srt

`

### Với LangChain

``` python
from langchain.document_loaders import WhisperTranscriptionLoader`loader = WhisperTranscriptionLoader(file_path="audio.mp3")
docs = loader.load()

# Use transcription in RAG
from langchain_chroma import Chroma
from langchain_OpenAI import OpenAIEmbeddings`vectorstore = Chroma.from_documents(docs, OpenAIEmbeddings())

`

### Trích xuất âm thanh từ video

`bash

# Use ffmpeg to extract audio
ffmpeg -i video.mp4 -vn -acodec pcm_s16le audio.wav

# Then transcribe
whisper audio.wav

`

## Các phương pháp hay nhất
1. **Sử dụng model turbo** - Tốc độ/chất lượng tốt nhất cho tiếng Anh
2. **Chỉ định ngôn ngữ** - Nhanh hơn tự động phát hiện
3. **Thêm lời nhắc ban đầu** - Cải thiện thuật ngữ kỹ thuật
4. **Sử dụng GPU** - nhanh hơn 10-20×
5. **Quy trình hàng loạt** - Hiệu quả hơn
6. **Chuyển đổi sang WAV** - Khả năng tương thích tốt hơn
7. **Tách âm thanh dài** - <30 phút
8. **Kiểm tra hỗ trợ ngôn ngữ** - Chất lượng thay đổi tùy theo ngôn ngữ
9. **Sử dụng lời thì thầm nhanh hơn** - Nhanh hơn 4× so với lời thì thầm OpenAI
10. **Giám sát VRAM** - Chia tỷ lệ kích thước mô hình theo phần cứng

## Hiệu suất

| Người mẫu | Yếu tố thời gian thực (CPU) | Yếu tố thời gian thực (GPU) |
|-------|---------------------------------------|------------------------|
| nhỏ bé | ~0,32 | ~0,01 |
| căn cứ | ~0,16 | ~0,01 |
| tăng áp | ~0,08 | ~0,01 |
| lớn | ~1,0 | ~0,05 |

*Hệ số thời gian thực: nhanh hơn 0,1 = 10× so với thời gian thực*

## Hỗ trợ ngôn ngữ

Ngôn ngữ được hỗ trợ hàng đầu:
- Tiếng Anh (en)
- (các) tiếng Tây Ban Nha
- Tiếng Pháp (fr)
- Tiếng Đức (de)
- Ý ()
- Tiếng Bồ Đào Nha (pt)
- Tiếng Nga (ru)
- Tiếng Nhật (ja)
- Tiếng Hàn (ko)
- Tiếng Trung (zh)

Danh sách đầy đủ: tổng cộng 99 ngôn ngữ

## Hạn chế
1. **Ảo giác** - Có thể lặp lại hoặc bịa ra văn bản
2. **Độ chính xác ở dạng dài** - Giảm chất lượng ở âm thanh >30 phút
3. **Nhận dạng người nói** - Không ghi nhật ký
4. **Giọng** - Chất lượng khác nhau
5. **Tiếng ồn nền** - Có thể ảnh hưởng đến độ chính xác
6. **Độ trễ thời gian thực** - Không phù hợp để tạo phụ đề trực tiếp

## Tài nguyên- **GitHub**: https://GitHub.com/OpenAI/whisper ⭐ 72.900+
- **Giấy**: https://arxiv.org/abs/2212.04356
- **Thẻ mẫu**: https://GitHub.com/OpenAI/whisper/blob/main/model-card.md
- **Colab**: Có sẵn trong repo
- **Giấy phép**: MIT