Gemini 3.8 Live, 실시간 립싱크 아바타 탑재해 기업용 출시

Google DeepMind가 대화형 AI에 실시간 영상 아바타를 결합한 'Gemini 3.8 Live with Live Avatar'를 공개했습니다. 음성과 영상을 함께 생성해 보고 듣고 말하는 캐릭터를 만드는 기능으로, 9월 25일(한국 시각, 24일 16:20 UTC)부터 Gemini Enterprise에서 제공됩니다.
1/듣고 보고 말하는 아바타가 붙었다
9월 셋째 주에 나온 Gemini 3.8 Live에 이어, 이번에는 실시간 대화 모델에 영상까지 결합했습니다. 근실시간 영상 생성과 음성을 짝지어 립싱크, 자연스러운 표정, 매끄러운 turn-taking(말 주고받기)을 구현한 시각적 페르소나를 만듭니다. 시각·음성 입력을 동시에 처리해 대화를 진행하는 방식입니다.
2/백그라운드에서 도구를 부르면서도 대화는 끊기지 않는다
Live Avatar는 비동기 도구 호출(asynchronous tool calling)을 지원해, 대화가 이어지는 동안 백그라운드에서 데이터를 가져오거나 작업을 처리할 수 있습니다. 원문은 호텔 체크인 응대처럼 복잡한 작업을 처리하면서도 대화 흐름이 끊기지 않는 사례를 예시로 듭니다.
3/97개 언어를 오가도 영상이 흔들리지 않는다
네이티브 다국어 음성-음성 동기화 기능으로 립싱크와 표정을 실시간으로 맞춥니다. 97개 언어 사이를 전환해도 영상 품질 저하나 시각적 어긋남(visual drift) 없이 이어진다고 밝혔습니다.
4/기업은 자체 이미지로 아바타를 만들 수 있다
사전 제작된 다양한 아바타 라이브러리 외에, 기업은 고화질 레퍼런스 이미지 한 장으로 브랜드 스타일이나 캐릭터 정체성을 유지한 애니메이션 아바타를 만들 수 있습니다. 다만 커스텀 아바타 제작 기능은 현재 엔터프라이즈 화이트리스트 등록을 거친 곳에만 제공됩니다. 모든 출력물에는 SynthID 워터마크가 음성·영상에 삽입되어 AI 생성물임을 식별할 수 있게 했습니다.
5/이용 경로와 가격
Gemini 3.8 Live with Live Avatar는 9월 25일(한국 시각)부터 Gemini Enterprise에서 이용할 수 있으며, API 문서를 통해 시작할 수 있다고 안내합니다. 공지에는 단가나 요금제 정보는 나와 있지 않습니다.