ประเด็นสำคัญ
- การเปิดตัว: Google ประกาศเมื่อวันที่ 24 กันยายน 2026 เปิดตัว Gemini 3.8 Live with Live Avatar พร้อมให้ใช้งานทั่วไปสำหรับลูกค้า Gemini Enterprise ในสหรัฐอเมริกาและสหภาพยุโรป
- เทคโนโลยี: อวาตาร์เคลื่อนไหวพร้อมการสร้างวิดีโอแบบเกือบเรียลไทม์ ซิงค์ริมฝีปากได้ถึง 97 ภาษา พร้อมสลับภาษาได้กลางประโยค และรันเครื่องมือแบบอะซิงโครนัสในพื้นหลัง
- การนำไปใช้: ลูกค้ารายแรกที่เริ่มใช้งานแล้วคือ Cox Automotive, Equal AI และ Salesforce ในตลาดที่ Google กำลังไล่ตามคู่แข่งอย่าง HeyGen, OpenAI และ Anthropic
บทสนทนาที่เป็นมัลติโมดัลโดยธรรมชาติ
Google ได้ผสานการสร้างวิดีโอแบบเกือบเรียลไทม์เข้ากับโมเดลบทสนทนาเสียงพื้นเมืองของตนเอง อวาตาร์ประมวลผลข้อมูลภาพและเสียงพร้อมกัน มองเห็นสิ่งที่ผู้ใช้แสดงผ่านกล้องหรือการแชร์หน้าจอ และตอบสนองด้วยการแสดงออกทางสีหน้า การซิงค์ริมฝีปาก และการสลับบทสนทนาที่ลื่นไหล นี่ไม่ใช่วิดีโอที่บันทึกไว้ล่วงหน้าแล้วนำมาผสมกับเสียงสังเคราะห์ แต่คือการปรากฏตัวทางภาพที่ถูกสร้างขึ้นในขณะนั้นจริง
ฟีเจอร์นี้เปิดให้ใช้งานสำหรับลูกค้า Gemini Enterprise โดยมีจุดให้บริการในสหรัฐอเมริกาและสหภาพยุโรป พร้อมทรูพุตเฉพาะและมาตรฐานความสอดคล้องด้านองค์กร
97 ภาษา ไม่มีสะดุด
Live Avatar รองรับ 97 ภาษา และสามารถสลับจากภาษาหนึ่งไปอีกภาษาหนึ่งได้ในบทสนทนาเดียวกันโดยไม่ลดทอนความคมชัดของวิดีโอหรือทำให้ภาพเพี้ยน ตามรายงานของ The Verge วิดีโอสาธิตแสดงให้เห็นอวาตาร์พูดภาษาอังกฤษและญี่ปุ่นโดยที่การขยับปากสอดคล้องกับทั้งสองภาษา สำหรับองค์กรระดับโลก นี่หมายถึงเอเจนต์ภาพเดียวที่ใช้ได้กับทุกตลาด พร้อมระบบตรวจจับภาษาอัตโนมัติโดยไม่ต้องสลับด้วยมือ
ทำงานไปพร้อมกับพูดคุย
อวาตาร์สามารถเรียกใช้ระบบ ตรวจสอบข้อมูล และทำงานที่ซับซ้อนในพื้นหลังได้ในขณะที่บทสนทนายังดำเนินต่อไปโดยไม่สะดุด ในการสาธิตของ Google อวาตาร์ทำการเช็คอินให้แขกที่โรงแรมพร้อมพูดคุยไปด้วยในขณะที่ระบบดำเนินการคู่ขนานกัน ในอีกการสาธิตหนึ่ง เอเจนต์ประกันภัยวิเคราะห์ความเสียหายที่แสดงผ่านกล้องของลูกค้า ในขณะที่ทีมเอเจนต์ที่สร้างด้วย Agent Development Kit ตรวจสอบกรมธรรม์และเตรียมเอกสารเคลม
นักพัฒนาสามารถผสานฟีเจอร์เหล่านี้ผ่าน Agent Development Kit ของ Google โดยกำหนดหน่วยความจำและการสตรีมเสียงโดยไม่ต้องผ่านระบบ speech-to-text แบบดั้งเดิม
ใบหน้าที่ปรับแต่งได้ตามแบรนด์
องค์กรสามารถเลือกจากคลังอวาตาร์สำเร็จรูป หรือสร้างอวาตาร์แบบกำหนดเองจากภาพอ้างอิง โดยคงความคล้ายคลึง สไตล์แบรนด์ หรืออัตลักษณ์ของตัวละครไว้ได้ การสร้างอวาตาร์แบบกำหนดเองต้องเข้าถึงผ่านระบบอนุญาตพิเศษขององค์กร ซึ่งเป็นตัวกรองที่ Google ตั้งใจวางไว้
ประเด็นเรื่องความน่าเชื่อถือ: SynthID และมาตรการป้องกัน
Google ระบุว่าได้วางมาตรการป้องกันเพื่อเคารพอัตลักษณ์บุคคลและรักษาความโปร่งใสของเนื้อหาที่สร้างโดย AI โดยมีลายน้ำ SynthID ที่มองไม่เห็นฝังอยู่ในทุกสตรีมเสียงและวิดีโอที่ถูกสร้างขึ้น
ใครบ้างที่เริ่มสร้างบนแพลตฟอร์มนี้แล้ว
Cox Automotive สร้างผู้ช่วยช้อปปิ้งบน Autotrader ที่ช่วยแนะนำผู้ซื้อในการค้นหาและเปรียบเทียบรถยนต์แบบเรียลไทม์ Equal AI จัดการสายเรียกเข้าสดมากกว่าหนึ่งล้านสายต่อวันในเก้าภาษาของอินเดีย โดยรายงานว่ามีการปรับปรุงในการจัดการการขัดจังหวะและบทสนทนาหลายภาษา Salesforce กำลังผสาน Agentforce เข้ากับความสามารถของ Gemini 3.8 Live
สิ่งที่เปลี่ยนไปสำหรับคนอื่นๆ
อวาตาร์แบบ Live รองรับการโต้ตอบต่อเนื่องได้เพียงไม่กี่นาที ไม่ใช่หลายชั่วโมง และในตอนนี้ฟีเจอร์นี้ยังจำกัดเฉพาะองค์กรเท่านั้น การเปิดตัวครั้งนี้เกิดขึ้นในช่วงเวลาที่ละเอียดอ่อนสำหรับ Google ท่ามกลางรายงานความล่าช้าของ Gemini 3.5 Pro และการเปิดตัวของคู่แข่งอย่าง OpenAI และ Anthropic Live Avatar วาง Google ให้แข่งขันกับสตาร์ทอัพอย่าง HeyGen โดยมีข้อได้เปรียบคือ อวาตาร์ไม่ได้เป็นผลิตภัณฑ์แยกต่างหาก แต่ถูกผสานเข้ากับรันไทม์ของโมเดลโดยตรง
