GPT-Live-1 ใน API: Voice Agent ฟังและพูดพร้อมกัน พร้อมรองรับโทรศัพท์
OpenAI เปิด GPT-Live-1 ให้สร้าง voice agent แบบ full-duplex จัดการการขัดจังหวะ เสียงรบกวน และส่งงานคิดลึกไปยังโมเดลหลังบ้าน

GPT-Live-1 เป็นโมเดลเสียงแบบ full-duplex ใน API ที่ฟังและพูดพร้อมกัน จัดการการแทรกพูด ปรับน้ำเสียงและจังหวะ สนับสนุนสายโทรศัพท์ และส่งงาน reasoning หรือ tool call ไปยังโมเดลข้อความด้านหลังได้
เหมาะสำหรับ: ทีมที่ทำศูนย์บริการ ระบบนัดหมาย ผู้ช่วยเสียง หรือ workflow ทางโทรศัพท์ซึ่งต้องการบทสนทนาธรรมชาติกว่า pipeline หลายโมเดลประเด็นสำหรับนำไปทดลอง
สิ่งที่เปลี่ยน
จาก voice pipeline ที่แยก speech-to-text, reasoning และ text-to-speech นักพัฒนาสามารถใช้โมเดลเสียงเดียวดูจังหวะรับส่งเสียง แล้วเลือกโมเดลหรือ agent ด้านหลังให้เหมาะกับความยากของงาน
การเปิดให้ใช้และข้อจำกัด
OpenAI ระบุว่า GPT-Live-1 ใช้ได้ใน API ตั้งแต่ 10 กันยายน ส่วน custom voice ต้องติดต่อฝ่ายขายและผ่านกระบวนการขอสิทธิ์ ตัวเลือกเสียงและภาษาจะขยายต่อ จึงต้องตรวจคุณภาพภาษาไทยจากบัญชีและสถานการณ์จริง
ผลต่อองค์กรไทย
เหมาะทดลองกับสายบริการที่มีบทสนทนาซ้ำและส่งต่อเจ้าหน้าที่ได้ชัด ควรวัดการขัดจังหวะผิด การเข้าใจชื่อ เลขอ้างอิง และเสียงสถานที่จริง ไม่ใช้ตัวเลขของลูกค้าต่างประเทศแทนผลทดสอบไทย
วันที่และหลักฐาน
วันประกาศและวันเริ่มให้ใช้ API คือ 10 กันยายน 2026 ไม่พบวันที่แก้ไขบทความต้นทางแยก
ก่อนเริ่มใช้งาน
- แจ้งและขอความยินยอมเมื่อบันทึกเสียง
- ออกแบบปุ่มหรือคำสั่งส่งต่อคน
- ทดสอบชื่อไทย ตัวเลข และศัพท์เฉพาะ
- จำกัด tool call ที่สร้างผลผูกพัน
- วัด latency ปลายทางถึงปลายทาง
คำถามที่พบบ่อย
รองรับภาษาไทยสมบูรณ์หรือไม่?
ประกาศกล่าวถึงภาษาและสำเนียงที่เพิ่มขึ้น แต่ไม่ได้รับรองผลภาษาไทยทุกสถานการณ์ จึงต้องทดสอบกับเสียงและศัพท์ขององค์กร
ควรให้ voice agent ยืนยันรายการแทนคนเลยหรือไม่?
งานที่มีผลทางการเงินหรือข้อมูลสำคัญควรอ่านทวน ให้ผู้ใช้ยืนยัน และมีทางส่งต่อเจ้าหน้าที่
แหล่งข้อมูลที่ใช้ตรวจสอบ
เราแยกข้อมูลจากผู้ให้บริการออกจากคำแนะนำของ TechTouch อย่างชัดเจน ฟีเจอร์ ราคา และเงื่อนไขอาจเปลี่ยนแปลง ควรตรวจข้อมูลล่าสุดในวันที่จัดซื้อ