ประเด็นสำคัญ

  • การเปิดตัว: Google ประกาศเมื่อวันที่ 24 กันยายน 2026 เปิดตัว Gemini 3.8 Live with Live Avatar พร้อมให้ใช้งานทั่วไปสำหรับลูกค้า Gemini Enterprise ในสหรัฐอเมริกาและสหภาพยุโรป
  • เทคโนโลยี: อวาตาร์เคลื่อนไหวพร้อมการสร้างวิดีโอแบบเกือบเรียลไทม์ ซิงค์ริมฝีปากได้ถึง 97 ภาษา พร้อมสลับภาษาได้กลางประโยค และรันเครื่องมือแบบอะซิงโครนัสในพื้นหลัง
  • การนำไปใช้: ลูกค้ารายแรกที่เริ่มใช้งานแล้วคือ Cox Automotive, Equal AI และ Salesforce ในตลาดที่ Google กำลังไล่ตามคู่แข่งอย่าง HeyGen, OpenAI และ Anthropic

บทสนทนาที่เป็นมัลติโมดัลโดยธรรมชาติ

Google ได้ผสานการสร้างวิดีโอแบบเกือบเรียลไทม์เข้ากับโมเดลบทสนทนาเสียงพื้นเมืองของตนเอง อวาตาร์ประมวลผลข้อมูลภาพและเสียงพร้อมกัน มองเห็นสิ่งที่ผู้ใช้แสดงผ่านกล้องหรือการแชร์หน้าจอ และตอบสนองด้วยการแสดงออกทางสีหน้า การซิงค์ริมฝีปาก และการสลับบทสนทนาที่ลื่นไหล นี่ไม่ใช่วิดีโอที่บันทึกไว้ล่วงหน้าแล้วนำมาผสมกับเสียงสังเคราะห์ แต่คือการปรากฏตัวทางภาพที่ถูกสร้างขึ้นในขณะนั้นจริง

ฟีเจอร์นี้เปิดให้ใช้งานสำหรับลูกค้า Gemini Enterprise โดยมีจุดให้บริการในสหรัฐอเมริกาและสหภาพยุโรป พร้อมทรูพุตเฉพาะและมาตรฐานความสอดคล้องด้านองค์กร



Google เปิดตัว Gemini 3.8 Live Avatar สำหรับองค์กร - Foto 1

97 ภาษา ไม่มีสะดุด

Live Avatar รองรับ 97 ภาษา และสามารถสลับจากภาษาหนึ่งไปอีกภาษาหนึ่งได้ในบทสนทนาเดียวกันโดยไม่ลดทอนความคมชัดของวิดีโอหรือทำให้ภาพเพี้ยน ตามรายงานของ The Verge วิดีโอสาธิตแสดงให้เห็นอวาตาร์พูดภาษาอังกฤษและญี่ปุ่นโดยที่การขยับปากสอดคล้องกับทั้งสองภาษา สำหรับองค์กรระดับโลก นี่หมายถึงเอเจนต์ภาพเดียวที่ใช้ได้กับทุกตลาด พร้อมระบบตรวจจับภาษาอัตโนมัติโดยไม่ต้องสลับด้วยมือ

ทำงานไปพร้อมกับพูดคุย

อวาตาร์สามารถเรียกใช้ระบบ ตรวจสอบข้อมูล และทำงานที่ซับซ้อนในพื้นหลังได้ในขณะที่บทสนทนายังดำเนินต่อไปโดยไม่สะดุด ในการสาธิตของ Google อวาตาร์ทำการเช็คอินให้แขกที่โรงแรมพร้อมพูดคุยไปด้วยในขณะที่ระบบดำเนินการคู่ขนานกัน ในอีกการสาธิตหนึ่ง เอเจนต์ประกันภัยวิเคราะห์ความเสียหายที่แสดงผ่านกล้องของลูกค้า ในขณะที่ทีมเอเจนต์ที่สร้างด้วย Agent Development Kit ตรวจสอบกรมธรรม์และเตรียมเอกสารเคลม



Google เปิดตัว Gemini 3.8 Live Avatar สำหรับองค์กร - Foto 2

นักพัฒนาสามารถผสานฟีเจอร์เหล่านี้ผ่าน Agent Development Kit ของ Google โดยกำหนดหน่วยความจำและการสตรีมเสียงโดยไม่ต้องผ่านระบบ speech-to-text แบบดั้งเดิม

ใบหน้าที่ปรับแต่งได้ตามแบรนด์

องค์กรสามารถเลือกจากคลังอวาตาร์สำเร็จรูป หรือสร้างอวาตาร์แบบกำหนดเองจากภาพอ้างอิง โดยคงความคล้ายคลึง สไตล์แบรนด์ หรืออัตลักษณ์ของตัวละครไว้ได้ การสร้างอวาตาร์แบบกำหนดเองต้องเข้าถึงผ่านระบบอนุญาตพิเศษขององค์กร ซึ่งเป็นตัวกรองที่ Google ตั้งใจวางไว้

ประเด็นเรื่องความน่าเชื่อถือ: SynthID และมาตรการป้องกัน

Google ระบุว่าได้วางมาตรการป้องกันเพื่อเคารพอัตลักษณ์บุคคลและรักษาความโปร่งใสของเนื้อหาที่สร้างโดย AI โดยมีลายน้ำ SynthID ที่มองไม่เห็นฝังอยู่ในทุกสตรีมเสียงและวิดีโอที่ถูกสร้างขึ้น

ใครบ้างที่เริ่มสร้างบนแพลตฟอร์มนี้แล้ว

Cox Automotive สร้างผู้ช่วยช้อปปิ้งบน Autotrader ที่ช่วยแนะนำผู้ซื้อในการค้นหาและเปรียบเทียบรถยนต์แบบเรียลไทม์ Equal AI จัดการสายเรียกเข้าสดมากกว่าหนึ่งล้านสายต่อวันในเก้าภาษาของอินเดีย โดยรายงานว่ามีการปรับปรุงในการจัดการการขัดจังหวะและบทสนทนาหลายภาษา Salesforce กำลังผสาน Agentforce เข้ากับความสามารถของ Gemini 3.8 Live



Google เปิดตัว Gemini 3.8 Live Avatar สำหรับองค์กร - Foto 3

สิ่งที่เปลี่ยนไปสำหรับคนอื่นๆ

อวาตาร์แบบ Live รองรับการโต้ตอบต่อเนื่องได้เพียงไม่กี่นาที ไม่ใช่หลายชั่วโมง และในตอนนี้ฟีเจอร์นี้ยังจำกัดเฉพาะองค์กรเท่านั้น การเปิดตัวครั้งนี้เกิดขึ้นในช่วงเวลาที่ละเอียดอ่อนสำหรับ Google ท่ามกลางรายงานความล่าช้าของ Gemini 3.5 Pro และการเปิดตัวของคู่แข่งอย่าง OpenAI และ Anthropic Live Avatar วาง Google ให้แข่งขันกับสตาร์ทอัพอย่าง HeyGen โดยมีข้อได้เปรียบคือ อวาตาร์ไม่ได้เป็นผลิตภัณฑ์แยกต่างหาก แต่ถูกผสานเข้ากับรันไทม์ของโมเดลโดยตรง