Gemini 3.5 Transcribe จาก Google พร้อมใช้งานผ่าน AI Gateway แล้ว
Gemini 3.5 Transcribe เปิดโอกาสใหม่ให้กับการแปลงเสียงเป็นข้อความ ซึ่งการรองรับได้มากกว่า 85 ภาษาและสามารถแยกแยะแนวเสียงได้ในขณะที่กำลังถูกบันทึก

ในยุคที่การแปลงเสียงเป็นข้อความสำคัญต่อการทำงานและการเรียนรู้ AI อย่างยิ่ง Gemini 3.5 Transcribe จาก Google ที่เพิ่งปล่อยให้ใช้งานผ่าน AI Gateway นี้จะกลายเป็นเครื่องมือที่คุณไม่ควรพลาด สิ่งที่ทำให้มันน่าสนใจคือความสามารถที่เหนือกว่ารุ่นก่อนหน้าที่ไม่เพียงแค่แปลเสียงเป็นข้อความได้อย่างรวดเร็ว แต่ยังรองรับการทำงานในหลายสถานการณ์
เกิดอะไรขึ้นบ้าง?
Google ได้เปิดตัวโมเดล Gemini 3.5 Transcribe ผ่าน AI Gateway ซึ่งสามารถแปลงเสียงเป็นข้อความได้ด้วยการเชื่อมต่อ 2 วิธี: แบบบันทึกเสียงทั้งเรื่องและแบบถ่ายทอดสด ซึ่งเวอร์ชันถ่ายทอดสดนั้นจะทำการแปลงเสียงขณะที่กำลังถูกบันทึกและสามารถอัพเดทได้ทันที
นอกจากนี้ โมเดลยังสามารถตรวจจับภาษาด้วยตนเอง รองรับมากกว่า 85 ภาษา และติดตามเสียงเมื่อผู้พูดเปลี่ยนภาษาไปมาได้อย่างราบรื่น สามารถรองรับคำศัพท์เฉพาะเพิ่มเติมเพื่อจดจำชื่อหรือศัพท์เฉพาะทางได้อีกด้วย
ทำไมจึงสำคัญสำหรับนักพัฒนาไทย
สำหรับนักพัฒนาและผู้เรียนรู้ AI ในประเทศไทย Gemini 3.5 Transcribe ช่วยเปิดโอกาสในการทำงานกับหลักภาษาและเสียงที่หลากหลาย ซึ่งจะมีประโยชน์อย่างยิ่งในธุรกิจที่ต้องการการสนทนาหรือบันทึกที่เป็นหลายภาษา และช่วยเพิ่มความสามารถของบอทหรือระบบอัตโนมัติที่ต้องประมวลผลจากเสียง
ทำอย่างไรถ้าคุณต้องการลองใช้งาน
สำหรับผู้ที่สนใจใช้งาน Gemini 3.5 Transcribe สามารถเริ่มต้นได้อย่างง่ายดายโดยการติดตั้ง AI SDK เวอร์ชันล่าสุดและเริ่มการทดสอบแปลงเสียงตามตัวอย่างโค้ดที่ให้มา การใช้งานกับเสียงที่อัดไว้หรือการถ่ายทอดสดก็มีตัวเลือกให้เลือกตามต้องการ
หากคุณต้องการลองใช้งานโดยไม่ต้องเขียนโค้ด คุณสามารถเปิดใช้ Gemini 3.5 Transcribe Live และส่งเสียงผ่านเว็บเบราว์เซอร์เพื่อรับข้อความที่แปลงแล้วได้เลย
ที่มา: Vercel Changelog


