Chuyển tới nội dung chính

Giọng nói & TTS

Hermes Agent hỗ trợ cả đầu ra chuyển văn bản thành giọng nói và sao chép tin nhắn thoại trên tất cả các nền tảng nhắn tin.

Nous Subscribers

Nếu bạn có đăng ký Nous Portal trả phí, OpenAI TTS có sẵn thông qua Tool Gateway mà không cần khóa API OpenAI riêng. Các bản cài đặt mới có thể chạy Hermes setup --portal để đăng nhập và bật mọi công cụ cổng cùng một lúc; các lượt cài đặt hiện có có thể chọn Đăng ký Nous chỉ cho TTS qua Hermes model hoặc `Hermes tools

.

Chuyển văn bản thành giọng nói

Chuyển đổi văn bản thành giọng nói với mười nhà cung cấp:

Nhà cung cấpChất lượngChi phíKhóa API
** Edge TTS** (mặc định)TốtMiễn phíKhông cần thiết
ElevenLabsXuất sắcĐã trả tiền

ELEVENLABS_API_KEY ` | | OpenAI TTS | Tốt | Đã trả tiền |

VOICE_TOOLS_OpenAI_KEY ` | | TTS MiniMax | Xuất sắc | Đã trả tiền |

MiniMax_API_KEY ` | | Mistral (Voxtral TTS) | Xuất sắc | Đã trả tiền |

Mistral_API_KEY ` | | Google Song Tử TTS | Xuất sắc | Cấp miễn phí |

Gemini_API_KEY ` | | xAI TTS | Xuất sắc | Đã trả tiền |

XAI_API_KEY ` | | NeuTTS | Tốt | Miễn phí (địa phương) | Không cần thiết | | Mèo con | Tốt | Miễn phí (địa phương) | Không cần thiết | | Người thổi sáo | Tốt | Miễn phí (địa phương) | Không cần thiết |

Phân phối nền tảng

Nền tảngGiao hàngĐịnh dạng
TelegramBong bóng thoại (phát nội tuyến)Opus

.ogg ` | | Discord | Bong bóng thoại (Opus/OGG), quay lại tệp đính kèm | Tác phẩm/MP3 | | WhatsApp | Tệp đính kèm âm thanh | MP3 | | CLI | Đã lưu vào

~/.Hermes/audio_cache/ ` | MP3 |

Cấu hình


# In ~/.Hermes/config.yaml
tts:
provider: "edge" # "edge" | "elevenlabs" | "OpenAI" | "MiniMax" | "Mistral" | "Gemini" | "xai" | "neutts" | "kittentts" | "piper"
speed: 1.0 # Global speed multiplier (provider-specific settings override this)
edge:
voice: "en-US-AriaNeural" # 322 voices, 74 languages
speed: 1.0 # Converted to rate percentage (+/-%)
elevenlabs:
voice_id: "pNInz6obpgDQGcFmaJgB" # Adam
model_id: "eleven_multilingual_v2"
OpenAI:
model: "GPT-4o-mini-tts"
voice: "alloy" # alloy, echo, fable, onyx, nova, shimmer
base_url: "https://API.OpenAI.com/v1" # Override for OpenAI-compatible TTS endpoints
speed: 1.0 # 0.25 - 4.0
MiniMax:
model: "speech-2.8-hd" # speech-2.8-hd (default), speech-2.8-turbo
voice_id: "English_Graceful_Lady" # See https://platform.MiniMax.io/faq/system-voice-id
speed: 1 # 0.5 - 2.0
vol: 1 # 0 - 10
pitch: 0 # -12 - 12
Mistral:
model: "voxtral-mini-tts-2603"
voice_id: "c69964a6-ab8b-4f8a-9465-ec0925096ec8" # Paul - Neutral (default)
Gemini:
model: "Gemini-2.5-flash-preview-tts" # or Gemini-2.5-pro-preview-tts
voice: "Kore" # 30 prebuilt voices: Zephyr, Puck, Kore, Enceladus, Gacrux, etc.
xai:
voice_id: "eve" # or a custom voice ID — see docs below
language: "en" # ISO 639-1 code
sample_rate: 24000 # 22050 / 24000 (default) / 44100 / 48000
bit_rate: 128000 # MP3 bitrate; only applies when codec=mp3
# base_url: "https://API.x.ai/v1" # Override via XAI_BASE_URL env var
neutts:
ref_audio: ''
ref_text: ''
model: neuphonic/neutts-air-q4-gguf
device: cpu
kittentts:
model: KittenML/kitten-tts-nano-0.8-int8 # 25MB int8; also: kitten-tts-micro-0.8 (41MB), kitten-tts-mini-0.8 (80MB)
voice: Jasper # Jasper, Bella, Luna, Bruno, Rosie, Hugo, Kiki, Leo
speed: 1.0 # 0.5 - 2.0
clean_text: true # Expand numbers, currencies, units
piper:
voice: en_US-lessac-medium # voice name (auto-downloaded) OR absolute path to .onnx
# voices_dir: '' # default: ~/.Hermes/cache/piper-voices/
# use_cuda: false # requires onnxruntime-gpu
# length_scale: 1.0 # 2.0 = twice as slow
# noise_scale: 0.667
# noise_w_scale: 0.8
# volume: 1.0 # 0.5 = half as loud
# normalize_audio: true

`
``**Kiểm soát tốc độ**: Giá trị
`tts.speed
` toàn cầu áp dụng cho tất cả các nhà cung cấp theo mặc định. Mỗi nhà cung cấp có thể ghi đè cài đặt đó bằng cài đặt
`speed
` của riêng mình (ví dụ:
`tts.OpenAI.speed: 1.5

). Tốc độ dành riêng cho nhà cung cấp được ưu tiên hơn giá trị chung. Mặc định là
`1.0
` (tốc độ bình thường).

### Giới hạn độ dài đầu vào

Mỗi nhà cung cấp có giới hạn ký tự đầu vào cho mỗi yêu cầu được ghi lại. Hermes cắt bớt văn bản trước khi gọi cho nhà cung cấp để các yêu cầu không bao giờ bị lỗi do lỗi độ dài:

| Nhà cung cấp | Giới hạn mặc định (ký tự) |
|----------|----------------------|
| TTS cạnh | 5000 |
| OpenAI | 4096 |
| xAI | 15000 |
| MiniMax | 10000 |
| Mistral | 4000 |
| Google Song Tử | 5000 |
| ElevenLabs | Nhận biết mô hình (xem bên dưới) |
| NeuTTS | 2000 |
| Mèo ConTTS | 2000 |

**ElevenLabs** chọn giới hạn từ
`model_id
` đã định cấu hình:`|
`model_id
` | Mũ (ký tự) |
|----------||-------------|
|
`eleven_flash_v2_5
` | 40000 |
|
`eleven_flash_v2
` | 30000 |
|
`eleven_multilingual_v2
` (mặc định),
`eleven_multilingual_v1

,
`eleven_english_sts_v2

,
`eleven_english_sts_v1
` | 10000 |
|
`eleven_v3

,
`eleven_ttv_v3
` | 5000 |
| Người mẫu không xác định | Quay trở lại mặc định của nhà cung cấp (10000) |

**Ghi đè lên mỗi nhà cung cấp** bằng
`max_text_length:
` trong phần nhà cung cấp trong cấu hình TTS của bạn:

``` yaml
tts:
OpenAI:
max_text_length: 8192 # raise or lower the provider cap

`
``Chỉ số nguyên dương mới được vinh danh. Các giá trị 0, âm, không phải số hoặc boolean được coi là giá trị mặc định của nhà cung cấp, do đó, cấu hình bị hỏng không thể vô tình vô hiệu hóa tính năng cắt bớt.

### Bong bóng giọng nói Telegram & ffmpeg

Bong bóng thoại Telegram yêu cầu định dạng âm thanh Opus/OGG:
- **OpenAI, ElevenLabs và Mistral** tự sản xuất Opus — không cần thiết lập thêm

- **Edge TTS** (mặc định) xuất MP3 và cần **ffmpeg** để chuyển đổi:
- **MiniMax TTS** xuất MP3 và cần **ffmpeg** để chuyển đổi cho bong bóng thoại Telegram
- **Google Gemini TTS** xuất PCM thô và sử dụng **ffmpeg** để mã hóa Opus trực tiếp cho bong bóng thoại Telegram
- **xAI TTS** xuất MP3 và cần **ffmpeg** để chuyển đổi cho bong bóng thoại Telegram
- **NeuTTS** xuất ra WAV và cũng cần **ffmpeg** để chuyển đổi cho bong bóng thoại Telegram
- **KittenTTS** xuất WAV và cũng cần **ffmpeg** để chuyển đổi cho bong bóng thoại Telegram
- **piper** xuất WAV và cũng cần **ffmpeg** để chuyển đổi cho bong bóng thoại Telegram

``` bash

# Ubuntu/Debian
sudo apt install ffmpeg

# macOS
brew install ffmpeg

# Fedora
sudo dnf install ffmpeg

`
``Nếu không có ffmpeg, âm thanh Edge TTS, MiniMax TTS, NeuTTS, KittenTTS và piper sẽ được gửi dưới dạng tệp âm thanh thông thường (có thể phát nhưng được hiển thị dưới dạng trình phát hình chữ nhật thay vì bong bóng thoại).

:::tip
Nếu bạn muốn bong bóng thoại mà không cần cài đặt ffmpeg, hãy chuyển sang nhà cung cấp OpenAI, ElevenLabs hoặc Mistral.
:::

### xAI Giọng nói tùy chỉnh (nhân bản giọng nói)

xAI hỗ trợ sao chép giọng nói của bạn và sử dụng nó với TTS. Tạo giọng nói tùy chỉnh trong [xAI Console](https://console.x.ai/team/default/voice/voice-library), sau đó đặt
`voice_id
` kết quả trong cấu hình của bạn:

`
``` yaml
tts:
provider: xai
xai:
voice_id: "nlbqfwie" # your custom voice ID

`
``Xem [xAI Custom Voices docs](https://docs.x.ai/developers/model-capabilities/audio/custom-voices) để biết chi tiết về ghi, định dạng được hỗ trợ và giới hạn.

### piper (địa phương, 44 ngôn ngữ)

piper là một công cụ TTS thần kinh cục bộ, nhanh chóng của Open Home Foundation (đơn vị bảo trì Home Assistant). Nó chạy hoàn toàn trên CPU, hỗ trợ **44 ngôn ngữ** với giọng nói được đào tạo trước và không cần khóa API.

**Cài đặt qua
`Hermes tools

`
** → Giọng nói & TTS → piper - Hermes chạy
`pip install piper-tts
` cho bạn. Hoặc cài đặt thủ công:
`pip install piper-tts

.

**Chuyển sang piper:**

``` yaml
tts:
provider: piper
piper:
voice: en_US-lessac-medium

`
``Trong cuộc gọi TTS đầu tiên cho giọng nói không được lưu vào bộ nhớ đệm cục bộ, Hermes chạy
`Python -m piper.download_voices <name
` và tải mô hình (~20-90 MB tùy thuộc vào bậc chất lượng) vào

~/.Hermes/cache/piper-voices/

. Các cuộc gọi tiếp theo sẽ sử dụng lại mô hình đã lưu trong bộ nhớ đệm.

**Chọn giọng nói.** [full voice catalog](https://GitHub.com/OHF-Voice/piper1-gpl/blob/main/docs/VOICES.md) bao gồm tiếng Anh, tiếng Tây Ban Nha, tiếng Pháp, tiếng Đức, tiếng Ý, tiếng Hà Lan, tiếng Bồ Đào Nha, tiếng Nga, tiếng Ba Lan, tiếng Thổ Nhĩ Kỳ, tiếng Trung, tiếng Ả Rập, tiếng Hindi, v.v. — mỗi tiếng Anh đều có bậc chất lượng
`x_low
` /
`low
` /
`medium
` /
`high

. Giọng mẫu tại [rhasspy.GitHub.io/piper-samples](https://rhasspy.GitHub.io/piper-samples/).

**Sử dụng giọng nói được tải xuống trước.** Đặt
`tts.piper.voice
` thành đường dẫn tuyệt đối kết thúc bằng

.onnx

:

`YAML
tts:
piper:
voice: /path/to/my-custom-voice.onnx

`
``**Núm nâng cao** (
`tts.piper.length_scale
` /
`noise_scale
` /
`noise_w_scale
` /
`volume
` /
`normalize_audio

,
`use_cuda

) tương ứng 1:1 với
`SynthesisConfig
` của piper. Chúng bị bỏ qua trên các phiên bản
`piper-tts
` cũ hơn.

### Nhà cung cấp lệnh tùy chỉnh

Nếu công cụ TTS bạn muốn không được hỗ trợ nguyên bản (VoxCPM, MLX-Kokoro, XTTS CLI, tập lệnh sao chép giọng nói, bất kỳ nội dung nào khác hiển thị CLI), thì bạn có thể kết nối nó với tư cách là **nhà cung cấp loại lệnh** mà không cần viết bất kỳ Python nào. Hermes ghi văn bản đầu vào vào tệp UTF-8 tạm thời, chạy lệnh shell của bạn và đọc tệp âm thanh mà lệnh tạo ra.

Khai báo một hoặc nhiều nhà cung cấp trong
`tts.providers.<name>
` và chuyển đổi giữa chúng bằng
`tts.provider: <name>
` — giống như cách bạn chuyển đổi giữa các phần mềm tích hợp như
`edge
` và
`OpenAI

.

`YAML
tts:
provider: voxcpm # pick any name under tts.providers
providers:
voxcpm:
type: command
command: "voxcpm --ref ~/voice.wav --text-file \{input_path} --out \{output_path}"
output_format: mp3
timeout: 180
voice_compatible: true # try to deliver as a Telegram voice bubble`mlx-kokoro:
type: command
command: "Python -m mlx_kokoro --in \{input_path} --out \{output_path} --voice \{voice}"
voice: af_sky
output_format: wav`piper-custom: # native piper also supports custom .onnx via tts.piper.voice
type: command
command: "piper -m /path/to/custom.onnx -f \{output_path} < \{input_path}"
output_format: wav

`

#### Ví dụ: Doubao (Hạt giống Trung Quốc-tts-2.0)

Để có TTS tiếng Trung chất lượng cao thông qua API phát trực tuyến hai chiều [seed-tts-2.0](https://www.volcengine.com/docs/6561/1257544) của ByteDance, hãy cài đặt gói [XPROTECTX62XPROTECTX](https://pypi.org/project/doubao-speech/) PyPI và kết nối nó với tư cách là nhà cung cấp lệnh:

`bash
pip install doubao-speech
export VOLCENGINE_APP_ID="your-app-id"
export VOLCENGINE_ACCESS_TOKEN="your-access-token"

`

`
`YAML
tts:
provider: doubao
providers:
doubao:
type: command
command: "doubao-speech say --text-file \{input_path} --out \{output_path}"
output_format: mp3
max_text_length: 1024
timeout: 30

`
``Thông tin xác thực đến từ môi trường shell của bạn (
`VOLCENGINE_APP_ID
` /
`VOLCENGINE_ACCESS_TOKEN

) hoặc

~/.doubao-speech/config.yaml

. Chọn một giọng nói bằng cách thêm

`
--voice zh-female-warm
` (hoặc bất kỳ bí danh nào khác từ
`doubao-speech list-voices

) vào lệnh.
`doubao-speech
` cũng tích hợp ASR phát trực tuyến - xem [STT section below](#example-doubao--volcengine-asr) để tích hợp Hermes. Nguồn và tài liệu đầy đủ: [GitHub.com/Hypnus-Yuan/doubao-speech](https://GitHub.com/Hypnus-Yuan/doubao-speech).

#### Phần giữ chỗ

Mẫu lệnh của bạn có thể tham chiếu các phần giữ chỗ này. Hermes thay thế chúng tại thời điểm kết xuất và trích dẫn shell từng giá trị cho bối cảnh xung quanh (trống/trích dẫn đơn/trích dẫn kép), vì vậy các đường dẫn có dấu cách và các ký tự nhạy cảm với shell khác được an toàn.

| Trình giữ chỗ | Ý nghĩa |
|-------------------|-------------------------------------------------------------------|
|

\{input_path}
` | Đường dẫn đến tệp văn bản UTF-8 tạm thời mà Hermes đã viết |
|

\{text_path}
` | Bí danh cho

\{input_path}
` |
|

\{output_path}
` | Đường dẫn lệnh phải ghi âm thanh vào |
|

\{format}
` |
`mp3
` /
`wav
` /
`ogg
` /
`flac
` |
|

\{voice}
` |
`tts.providers.<name>.voice

, trống khi không được đặt |
|

\{model}
` |
`tts.providers.<name>.model
` |
|

\{speed}
` | Đã giải quyết hệ số nhân tốc độ (nhà cung cấp hoặc toàn cầu) |

Sử dụng

\{{
` và

}}
` cho dấu ngoặc nhọn.

#### Phím tùy chọn| Chìa khóa | Mặc định | Ý nghĩa |
|-----------------------------------|----------|-------------------------------------------------------------------------------------------------------------------------|
|
`timeout
` |
`120
` | Giây; cây quy trình bị hủy khi hết hạn (Unix
`killpg

, Windows
`taskkill /T

). |
|
`output_format
` |
`mp3
` | Một trong các
`mp3
` /
`wav
` /
`ogg
` /
`flac

. Tự động suy ra từ phần mở rộng đầu ra nếu Hermes chọn một đường dẫn. |
|
`voice_compatible
` |
`false
` | Khi
`true

, Hermes chuyển đổi đầu ra MP3/WAV thành Opus/OGG thông qua ffmpeg để Telegram hiển thị bong bóng thoại. |
|
`max_text_length
` |
`5000
` | Đầu vào được cắt ngắn theo độ dài này trước khi hiển thị lệnh. |
|
`voice
` /
`model
` | trống | Được chuyển tới lệnh chỉ dưới dạng giá trị giữ chỗ. |

#### Ghi chú hành vi
- **Tên tích hợp luôn giành chiến thắng.** Mục
`tts.providers.OpenAI
` không bao giờ che khuất nhà cung cấp OpenAI gốc, vì vậy không có cấu hình người dùng nào có thể âm thầm thay thế tên tích hợp.
- **Chế độ phân phối mặc định là một tài liệu.** Nhà cung cấp lệnh phân phối dưới dạng tệp đính kèm âm thanh thông thường trên mọi nền tảng. Chọn tham gia phân phối bong bóng thoại cho mỗi nhà cung cấp với
`voice_compatible: true

.
- **Lỗi lệnh xuất hiện đối với tác nhân.** Thoát khác 0, đầu ra trống hoặc hết thời gian chờ đều trả về lỗi kèm theo stderr/stdout của lệnh để bạn có thể gỡ lỗi nhà cung cấp khỏi cuộc trò chuyện.
- **
`type: command
` là mặc định khi
`command:
` được đặt.** Viết
`type: command
` một cách rõ ràng là cách làm tốt nhưng không bắt buộc; một mục nhập có chuỗi
`command
` không trống được coi là nhà cung cấp lệnh.
- **

\{input_path}
` /

\{text_path}
` có thể hoán đổi cho nhau.** Sử dụng bất kỳ giá trị nào đọc tốt hơn trong lệnh của bạn.

#### Bảo mật

Các nhà cung cấp loại lệnh chạy bất kỳ lệnh shell nào bạn định cấu hình với sự cho phép của người dùng. Hermes trích dẫn các giá trị giữ chỗ và thực thi thời gian chờ đã định cấu hình, nhưng bản thân mẫu lệnh là đầu vào cục bộ đáng tin cậy - xử lý nó giống như cách bạn xử lý tập lệnh shell trên PATH của mình.

## Phiên âm tin nhắn thoại (STT)

Tin nhắn thoại được gửi trên Telegram, Discord, WhatsApp, Slack hoặc Signal sẽ tự động được chép lại và đưa dưới dạng văn bản vào cuộc trò chuyện. Nhân viên xem bản ghi dưới dạng văn bản bình thường.

| Nhà cung cấp | Chất lượng | Chi phí | Khóa API |
|----------|----------|------|--------|
| **Lời thì thầm cục bộ** (mặc định) | Tốt | Miễn phí | Không cần thiết |
| **API thì thầm Groq** | Tốt–Tốt nhất | Cấp miễn phí |

GROQ_API_KEY
` |
| **API thì thầm OpenAI** | Tốt–Tốt nhất | Đã trả tiền |

VOICE_TOOLS_OpenAI_KEY
` hoặc
`OpenAI_API_KEY
` |

:::info[Zero Config]
Phiên âm cục bộ hoạt động ngay lập tức khi cài đặt
`faster-whisper

. Nếu điều đó không khả dụng, Hermes cũng có thể sử dụng CLI
`whisper
` cục bộ từ các vị trí cài đặt phổ biến (như

/opt/Homebrew/bin

) hoặc lệnh tùy chỉnh thông qua
`Hermes_LOCAL_STT_COMMAND

.
:::

### Cấu hình

``` yaml

# In ~/.Hermes/config.yaml
stt:
provider: "local" # "local" | "groq" | "OpenAI" | "Mistral" | "xai"
local:
model: "base" # tiny, base, small, medium, large-v3
OpenAI:
model: "whisper-1" # whisper-1, GPT-4o-mini-transcribe, GPT-4o-transcribe
Mistral:
model: "voxtral-mini-latest" # voxtral-mini-latest, voxtral-mini-2602
xai:
model: "grok-stt" # xAI Grok STT

`

### Chi tiết nhà cung cấp`**Cục bộ (thì thầm nhanh hơn)** — Chạy Whisper cục bộ thông qua [faster-whisper](https://GitHub.com/SYSTRAN/faster-whisper). Sử dụng CPU theo mặc định, GPU nếu có. Kích thước mô hình:

| Người mẫu | Kích thước | Tốc độ | Chất lượng |
|-------|------|-------|----------|
|
`tiny
` | ~75 MB | Nhanh nhất | Cơ bản |
|
`base
` | ~150 MB | Nhanh | Tốt (mặc định) |
|
`small
` | ~500 MB | Trung bình | Tốt hơn |
|
`medium
` | ~1,5 GB | Chậm hơn | Tuyệt vời |
|
`large-v3
` | ~3 GB | Chậm nhất | Tốt nhất |

**API Groq** — Yêu cầu
`GROQ_API_KEY

. Dự phòng đám mây tốt khi bạn muốn có tùy chọn STT được lưu trữ miễn phí.

**API OpenAI** — Chấp nhận
`VOICE_TOOLS_OpenAI_KEY
` trước và quay lại
`OpenAI_API_KEY

. Hỗ trợ
`whisper-1

,
`GPT-4o-mini-transcribe
` và
`GPT-4o-transcribe

.

**API Mistral (Phiên âm Voxtral)** - Yêu cầu
`Mistral_API_KEY

. Sử dụng các mẫu [Voxtral Transcribe](https://docs.Mistral.ai/capabilities/audio/speech_to_text/) của Mistral. Hỗ trợ 13 ngôn ngữ, ghi nhật ký người nói và dấu thời gian ở cấp độ từ. Cài đặt với
`pip install Hermes-agent[Mistral]

.**xAI Grok STT** — Yêu cầu
`XAI_API_KEY

. Đăng lên
`https://API.x.ai/v1/stt
` dưới dạng nhiều phần/biểu mẫu dữ liệu. Lựa chọn tốt nếu bạn đang sử dụng xAI để trò chuyện hoặc TTS và muốn có một khóa API cho mọi thứ. Lệnh tự động phát hiện đặt nó sau Groq - đặt rõ ràng
`stt.provider: xai
` để buộc nó.

**Dự phòng CLI cục bộ tùy chỉnh** — Đặt
`Hermes_LOCAL_STT_COMMAND
` nếu bạn muốn Hermes gọi trực tiếp lệnh phiên âm cục bộ. Mẫu lệnh hỗ trợ các phần giữ chỗ

\{input_path}

,

\{output_dir}

,

\{language}
` và

\{model}

. Lệnh của bạn phải viết bản ghi

.txt
` ở đâu đó bên dưới

\{output_dir}

.

#### Ví dụ: Doubao / Volcengine ASR

Nếu bạn sử dụng [XPROTECTX140XPROTECTX](https://pypi.org/project/doubao-speech/) cho Doubao TTS (xem [above](#example-doubao-chinese-seed-tts-20)), gói tương tự sẽ xử lý chuyển giọng nói thành văn bản thông qua bề mặt STT lệnh cục bộ:

``` bash
pip install doubao-speech
export VOLCENGINE_APP_ID="your-app-id"
export VOLCENGINE_ACCESS_TOKEN="your-access-token"
export Hermes_LOCAL_STT_COMMAND='doubao-speech transcribe \{input_path} --out \{output_dir}/transcript.txt'

`

`
`YAML
stt:
provider: local_command

`
``Hermes viết tin nhắn thoại đến

\{input_path}

, chạy lệnh và đọc tệp

.txt
` được tạo theo

\{output_dir}

. Ngôn ngữ được tự động phát hiện bởi điểm cuối bigmodel của Volcengine.

### Hành vi dự phòng

Nếu nhà cung cấp đã định cấu hình của bạn không có sẵn, Hermes sẽ tự động quay lại:

- **Không có tính năng thì thầm nhanh hơn cục bộ** → Dùng thử
`whisper
` CLI hoặc
`Hermes_LOCAL_STT_COMMAND
` cục bộ trước các nhà cung cấp đám mây
- **Khóa Groq chưa được đặt** → Quay lại phiên âm cục bộ, sau đó là OpenAI
- **Khóa OpenAI chưa được đặt** → Quay lại phiên âm cục bộ, sau đó là Groq
- **Chưa đặt khóa sai/SDK** → Bị bỏ qua trong tính năng tự động phát hiện; chuyển sang nhà cung cấp có sẵn tiếp theo
- **Không có gì** → Tin nhắn thoại được gửi kèm theo ghi chú chính xác cho người dùng