23 กรกฎาคม 2569
AI Gateway เพิ่มฟีเจอร์ streaming transcription รองรับการแปลเสียงแบบสดทันที
การพัฒนานี้ช่วยลดเวลาแฝงในการแปลเสียงสด ทำให้การใช้งานอย่างเช่น live captioning และ voice input สะดวกยิ่งขึ้น

การใช้ AI ในวงการเทคโนโลยีกำลังเร่งความเร็วมากขึ้นทุกวัน ล่าสุด AI Gateway ได้เพิ่มความสามารถในการรองรับผลลัพธ์การแปลเสียงแบบสด หรือที่เราเรียกว่า "streaming transcription" ซึ่งเป็นการลดเวลาแฝงในการแปลเสียงสด เช่นในงาน live captioning และ voice input ที่จำเป็นต้องได้รับข้อความแบบเรียลไทม์
ก่อนหน้านี้ การทำ transcription จำเป็นต้องมีไฟล์เสียงที่สมบูรณ์ก่อน ถึงจะสามารถคืนผลการแปลได้ ทั้งหมดนี้ทำให้เกิดเวลาแฝงที่สูง แต่ด้วยฟีเจอร์ใหม่นี้ เราสามารถส่งเสียงเข้าไปในขณะที่กำลังบันทึกได้และรับผลการแปลทันที ซึ่งทำให้สามารถใช้งานได้หลากหลายมากขึ้น
สิ่งนี้มีความสำคัญอย่างยิ่งสำหรับนักพัฒนาชาวไทยและผู้ที่กำลังเรียนรู้การพัฒนระบบด้วย AI เพราะจะทำให้สามารถสร้างแอปพลิเคชันหรือบริการที่มีความสามารถในการรับข้อมูลแบบเรียลไทม์ได้ อีกทั้งยังสามารถพัฒนาการสื่อสารแบบโต้ตอบผ่านเสียงกับผู้ใช้งาน โดยการนำเสียงของผู้ใช้เข้าระบบ transcription และนำข้อความที่ได้ไปใช้งานต่อกับ agent ของเราโดยไม่จำเป็นต้องปรับ agent ใด ๆ เนื่องจาก agent ยังคงรับข้อมูลเป็นข้อความตามปกติ
สำหรับนักพัฒนาที่ต้องการเริ่มใช้งาน ฟีเจอร์นี้สามารถทดสอบได้ผ่าน AI SDK ที่มีฟังก์ชัน streamTranscribe ซึ่งรองรับการใช้กับโมเดลที่สามารถทำงานแบบ streaming ไม่ว่าจะเป็นโมเดล openai/gpt-realtime-whisper หรืออื่นๆ ที่รองรับ มาทำการทดลองและปรับใช้ในระบบของตัวเอง
วิธีการใช้พื้นฐานก็เพียงแค่สลับชื่อโมเดลที่ต้องการใช้กับโค้ดที่มีให้ เลือกใช้โมเดลที่รองรับ streaming และเริ่มพัฒนาระบบที่ต้องการการแปลเสียงในแบบเรียลไทม์
ที่มา: Vercel Changelog


