ThonburianTTS - AI พูดภาษาไทย ฟรี รันในเครื่องได้ โคลนเสียงได้ โดยคนไทย
ThonburianTTS - AI พูดภาษาไทย ฟรี รันในเครื่องได้ โคลนเสียงได้ โดยคนไทย โดย Nokka (นก-กา) | 8 สิงหาคม 2569 บทความนี้เขียนโดย AI (deepseek-v4-pro) ผ่าน Hermes Agent ภายใต้การควบคุมและตรวจสอบคุณภาพโดยมนุษย์ - Nokka (นก-กา) ถ้าคุณกำลังมองหา Text-to-Speech ภาษาไทยที่รันในเครื่องตัวเองได้ ไม่ต้องเสียค่า API และฟังดูเป็นธรรมชาติ - ThonburianTTS คือคำตอบที่น่าสนใจที่สุดในตอนนี้ พัฒนาโดยทีมวิจัยจาก Mahidol University ร่วมกับ Looloo Technology โมเดลนี้ถูกนำเสนอในงานประชุมวิชาการ iSAI-NLP 2025 และเปิดให้ใช้ฟรีบน HuggingFace กับ GitHub [1][2] บทความนี้จะพาไปดูว่า ThonburianTTS คืออะไร ใช้ทำอะไรได้บ้าง ข้อดีข้อเสีย และเหมาะกับใคร ThonburianTTS คืออะไร ThonburianTTS เป็น Text-to-Speech ภาษาไทยที่พัฒนาต่อยอดจาก F5-TTS (Flow Matching) สถาปัตยกรรมที่ใช้เทคนิค diffusion-based flow matching เพื่อสร้างเสียงพูดที่เป็นธรรมชาติ [1] จุดเด่นที่ทำให้ ThonburianTTS แตกต่างจาก TTS ทั่วไป: | คุณสมบัติ | รายละเอียด | |---|---| | ภาษา | ภาษาไทยเป็นหลัก (รองรับทั้ง Thai script และ IPA) | | Voice Cloning | Zero-shot - ใช้เสียงตัวอย่างสั้นๆ (5-10 วินาที) เพื่อเลียนแบบเสียง | | การรัน | Local - รันบนเครื่องตัวเองได้ทั้ง GPU และ CPU | | ขนาดโมเดล | ~1.35 GB (ประมาณ 500M parameters) | | License | โค้ด MIT, โมเดล CC BY-NC-SA 4.0 (ห้ามใช้เชิงพาณิชย์) | | ผู้พัฒนา | Biomedical and Data Lab, Mahidol University + Looloo Technology | ใช้ทำอะไรได้บ้าง ThonburianTTS เหมาะกับงานที่ต้องการเสียงพูดภาษาไทยที่เป็นธรรมชาติ โดยไม่ต้องพึ่ง API ภายนอก [1]: - ระบบพากย์เสียงภาษาไทย - พากย์วิดีโอ, สื่อการสอน, audiobook - AI Voice Bot ภาษาไทย - ทำ chatbot ที่พูดภาษาไทยได้ - Voice Cloning ส่วนตัว - โคลนเสียงตัวเองหรือเสียงคนในทีม - ระบบอ่านข้อความภาษาไทย - อ่านบทความ, ข่าว, เอกสาร - งานวิจัยและพัฒนา - ต่อยอด TTS ภาษาไทยในเชิงวิชาการ จุดเด่นที่ทำให้ ThonburianTTS น่าสนใจ 1. เสียงภาษาไทยที่เป็นธรรมชาติ ThonburianTTS ถูก fine-tune บนข้อมูลภาษาไทยโดยเฉพาะ (GigaSpeech2) ทำให้ออกเสียงภาษาไทยได้ถูกต้องและเป็นธรรมชาติกว่าโมเดล multilingual ทั่วไป [1][3] ผู้ใช้หลายคนรายงานว่า ThonburianTTS ให้เสียงภาษาไทยที่ดีกว่า Qwen-TTS และ OmniVoice ซึ่งเป็นโมเดล multilingual ที่ไม่ได้ optimize สำหรับภาษาไทย 2. Voice Cloning แบบ Zero-Shot ใช้เสียงตัวอย่างสั้นๆ เพียง 5-10 วินาที ก็สามารถเลียนแบบเสียงต้นฉบับได้ โดยงานวิจัยต้นฉบับรายงาน similarity scores ที่ 84-89% [4] 3. รันในเครื่องได้ ไม่ต้องพึ่ง Cloud ติดตั้งผ่าน pip คำสั่งเดียว: pip install git+https://github.com/biodatlab/thonburian-tts.git ใช้ GPU (NVIDIA CUDA) หรือ CPU ก็ได้ - GPU จะเร็วกว่า แต่ CPU ก็รันได้ (ช้ากว่า) [1] 4. ปรับแต่งได้ - ปรับความเร็วเสียง (speed control) - ตัดช่วงเงียบ (silence trimming) - รักษาสไตล์เสียงต้นฉบับ (voice style preservation) 5. มี Gradio Demo ให้ลองใช้ ทีมพัฒนาทำ Gradio Web UI ให้ลองใช้ผ่าน HuggingFace Spaces ได้ทันที โดยไม่ต้องติดตั้งอะไร [1] ข้อจำกัดที่ควรรู้ 1. ไม่เหมาะกับข้อความยาว งานวิจัย JaiTTS (2026) ระบุว่า ThonburianTTS "fails to generate sensible output" สำหรับข้อความยาว เพราะถูกเทรนบน GigaSpeech2 ซึ่งเป็นชุดข้อมูลที่เน้น utterances สั้นๆ [3] 2. Zero-shot cloning ยังมีข้อจำกัด ถึงแม้ similarity scores จะสูง (84-89%) แต่ JaiTTS paper ระบุว่า ThonburianTTS ยังมีข้อจำกัดด้าน zero-shot speaker cloning เมื่อเทียบกับโมเดลที่ใหม่กว่า [3] 3. License ห้ามใช้เชิงพาณิชย์ - โค้ด: MIT (ใช้ได้อิสระ) - โมเดล: CC BY-NC-SA 4.0 - ห้ามใช้ในเชิงพาณิชย์ ถ้าจะใช้ต้องขออนุญาตจากทีมพัฒนา [1] 4. ต้องการ VRAM ~2-3 GB F5-TTS ต้องการ VRAM ประมาณ 2-3 GB สำหรับ inference - ถ้าใช้ CPU จะช้ากว่ามาก [5] เปรียบเทียบกับโมเดลอื่น | โมเดล | ภาษา | Voice Cloning | License | ขนาด | จุดเด่น | |---|---|---|---|---|---| | ThonburianTTS | ไทย (หลัก) | ✅ Zero-shot | CC BY-NC-SA 4.0 | ~1.35 GB | เสียงไทยธรรมชาติ, รัน local | | Qwen-TTS | หลายภาษา | ✅ | Apache 2.0 | 0.6B-1.7B | หลายภาษา, แข็งแกร่ง | | OmniVoice | หลายภาษา | ✅ | แตกต่างตามรุ่น | แตกต่าง | Voice cloning คุณภาพดี | | JaiTTS | ไทย (หลัก) | ✅ | CC BY 4.0 | ใหญ่กว่า | ข้อความยาวได้, CER 1.94% | สรุป: ThonburianTTS เหนือกว่าสำหรับงานภาษาไทยที่ต้องการความ natural และรัน local ได้ แต่ถ้าต้องการข้อความยาวหรือใช้เชิงพาณิชย์ ควรพิจารณา JaiTTS หรือ Qwen-TTS แทน เหมาะกับใคร เหมาะกับ - นักพัฒนาไทย ที่อยากทำระบบ TTS ภาษาไทยโดยไม่เสียค่า API - นักวิจัย ที่ต้องการต่อยอด TTS ภาษาไทย - ผู้ใช้ทั่วไป ที่อยากลอง voice cloning ภาษาไทย - งาน non-commercial - งานวิจัย, โปรเจกต์ส่วนตัว, งานอดิเรก เหมาะน้อยกว่า - งานเชิงพาณิชย์ - ต้องขอ license เพิ่มเติม - ข้อความยาว - ยังมีข้อจำกัด (แนะนำ JaiTTS แทน) - เครื่องไม่มี GPU - CPU รันได้แต่ช้ามาก วิธีเริ่มต้นใช้งาน # 1. ติดตั้ง pip install git+https://github.com/biodatlab/thonburian-tts.git # 2. ติดตั้ง ffmpeg (Linux) sudo apt install ffmpeg # 3. รันตัวอย่าง python f5tts_thai_example.py หรือลองผ่าน Gradio Demo บน HuggingFace Spaces โดยไม่ต้องติดตั้ง [1] สรุป ThonburianTTS เป็น TTS ภาษาไทยที่รันในเครื่องได้ ฟรี และให้เสียงที่เป็นธรรมชาติ - พัฒนาโดยทีมวิจัยไทยจาก Mahidol University จุดเด่นคือ voice cloning แบบ zero-shot, เสียงภาษาไทยที่ natural, และรัน local ได้โดยไม่ต้องพึ่ง API ข้อจำกัดคือยังไม่เหมาะกับข้อความยาว, license ห้ามใช้เชิงพาณิชย์, และต้องการ GPU สำหรับความเร็วที่ดี ถ้าคุณกำลังมองหา TTS ภาษาไทยที่รันในเครื่องได้และฟรี - ThonburianTTS คือตัวเลือกที่ควรลอง แหล่งอ้างอิง [1] biodatlab. "ThonburianTTS - Thai Text-to-Speech based on F5-TTS". GitHub. 2025. https://github.com/biodatlab/thonburian-tts [2] biodatlab. "ThonburianTTS". HuggingFace. 2025. https://huggingface.co/biodatlab/ThonburianTTS [3] Karnjanaekarin et al. "JaiTTS: A Thai Voice Cloning Model". arXiv. 2026. https://arxiv.org/html/2604.27607 [4] Aung et al. "ThonburianTTS: Enhancing Neural Flow Matching Models for Authentic Thai Text-to-Speech". iSAI-NLP 2025. doi: 10.1109/iSAI-NLP66160.2025.11320472. https://doi.org/10.1109/iSAI-NLP66160.2025.11320472 [5] Spheron Blog. "Self-Host AI Voice Cloning on GPU Cloud: XTTS-2, F5-TTS, and OpenVoice V2". 2026. https://www.spheron.network/blog/self-host-voice-cloning-gpu-cloud-xtts-f5-tts-openvoice-v2/ คุณเคยลองใช้ ThonburianTTS หรือ TTS ภาษาไทยตัวอื่นไหม? คิดว่า voice cloning ภาษาไทยตอนนี้ถึงจุดที่ใช้จริงได้หรือยัง? แชร์มุมมองใต้บทความได้เลยครับ - Nokka ยินดีแลกเปลี่ยน Top comments (0)
Comments
No comments yet. Start the discussion.