7lab Voice

Tài liệu

7Lab Voice chuyển văn bản thành giọng nói tự nhiên — 600+ ngôn ngữ, clone giọng từ clip 3–10 giây.

Bắt đầu nhanh

Không rành kỹ thuật: vào Tạo giọng, chọn mode, gõ text, bấm Tạo.

Dev: tạo khoá ở trang Khoá API, gọi REST hoặc gắn MCP.

  • Tạo một giọng: vào Giọng → Giọng mới, upload clip 3–10 giây nói rõ và nhập đúng lời thoại trong clip.
  • Tạo giọng nói: vào Tạo giọng, chọn giọng hoặc clip mẫu, gõ văn bản, bấm Tạo giọng nói.
  • Generate chạy qua hàng đợi (job chạy nền, theo dõi ở trang Công việc). Endpoint đồng bộ chỉ cho ≤250 ký tự.

Clone giọng

Hai cách clone: lưu giọng dùng lại nhiều lần (trang Giọng), hoặc clip mẫu một lần ngay trên trang Tạo giọng.

  • Clip mẫu 3–10 giây, giọng nói rõ, ít tạp âm.
  • Nhập đúng lời thoại của clip — transcript sai làm giọng lệch.
  • Giọng đã encode (trang Giọng) nhanh hơn clip một lần vì bỏ qua bước encode.

Thiết kế giọng

Không cần audio mẫu — mô tả giọng bằng các thuộc tính cố định (tiếng Anh, ngăn bởi dấu phẩy).

VD: female, young adult / male, british accent / child, high pitch. Hợp lệ: male, female, child, teenager, young adult, middle-aged, elderly, whisper, high/low/moderate pitch + accent.

REST API

Mọi chức năng trên web đều gọi được qua REST với khoá API:

# TTS đồng bộ (≤250 ký tự — trên CPU mất vài phút)
curl -X POST https://api.voice.7labx.com/v1/tts \
  -H "Authorization: Bearer 7lv_…" \
  -H "Content-Type: application/json" \
  -d '{ "text": "Xin chào", "mode": "auto" }'

# Văn bản dài → hàng đợi
curl -X POST https://api.voice.7labx.com/v1/jobs \
  -H "Authorization: Bearer 7lv_…" \
  -H "Content-Type: application/json" \
  -d '{ "text": "…", "mode": "clone", "voice_id": "…" }'

# Danh sách job / giọng
curl https://api.voice.7labx.com/v1/jobs -H "Authorization: Bearer 7lv_…"
curl https://api.voice.7labx.com/v1/voices -H "Authorization: Bearer 7lv_…"

# Tải audio
curl "https://api.voice.7labx.com/v1/audio/<job_id>?api_key=7lv_…" -o out.wav

MCP

Dán config sau vào Claude Desktop / Cursor / Devin để agent gọi TTS như tool:

{
  "mcpServers": {
    "7lab-voice": {
      "command": "npx",
      "args": ["-y", "@7labx/voice-mcp"],
      "env": { "VOICE_API_KEY": "7lv_…" }
    }
  }
}

FAQ

Bao lâu để có giọng nói?
Vài giây khi container đã nóng; lần đầu có thể lâu hơn do phải khởi động inference.

Văn bản dài tối đa bao nhiêu?
Đồng bộ tới 250 ký tự (mất vài phút trên CPU). Dài hơn hệ thống tự đưa vào hàng đợi — không giới hạn cứng.

Audio định dạng gì?
WAV. Tải về từ thanh kết quả hoặc trang Công việc.