Gemini 3.8 Live 공개 — 말하면서 도구를 돌리고 97개 언어를 중간에 바꿉니다 | DAKER 커뮤니티
말하다가 도구를 돌리고, 언어를 중간에 바꿔도 대화가 끊기지 않는다면 음성 에이전트 설계가 달라집니다. Google이 9월 15일 공개한 Gemini 3.8 Live와 3.8 Live Extended Thinking는 실시간 음성 대화용 모델입니다. Live는 비용·규모에, Extended Thinking는 복잡한 다단계 작업에 맞춰져 있습니다. 이 글에서는 두 모델의 차이, 제공 채널, 도입 시 확인할 점을 정리합니다.
Live와 Extended Thinking
Gemini 3.8 Live는 빠른 대화와 시각 그라운딩을 묶은 모델입니다. 화면을 보며 질문하고, 97개 지원 언어를 대화 중간에 자동으로 넘나듭니다. 도구와 API 호출은 뒤에서 돌리고, 사용자는 계속 말할 수 있습니다.
3.8 Live Extended Thinking는 더 깊은 추론이 필요할 때 씁니다. 생각하면서 동시에 말하고, “잠깐 확인할게요” 같은 짧은 응답으로 흐름을 유지한 뒤 다단계 작업 진행을 소리로 알려 줍니다. Artificial Analysis Speech to Speech Quality Index에서 Extended Thinking가 종합 1위(82.6)를 기록했다고 Google은 적었습니다. τ-Voice 68.6%, Big Bench Audio 97.7%도 함께 공개됐습니다.
Live는 규모와 비용, Extended Thinking는 복잡한 작업을 말하면서 끝내는 쪽입니다.
어디에 열렸나
개발자는 Gemini API와 Google AI Studio에서 시작할 수 있습니다. 일반 사용자 쪽으로는 Search Live, Gemini 앱의 Gemini Live, Workspace의 Docs·Gmail·Keep Live 등으로 단계적으로 열린다고 합니다. 엔터프라이즈는 Gemini Enterprise 비공개 프리뷰가 언급됐습니다. LiveKit, Pipecat, LangChain, Agora 등 실시간 미디어 스택 파트너도 나열됐습니다.
생성 오디오에는 SynthID 워터마크가 들어갑니다. 모델 카드와 안전 문서를 함께 확인하는 것이 좋습니다.
우리 팀에 들인다면
음성 상담·온보딩·현장 점검처럼 “손과 눈이 바쁜” 흐름부터 고릅니다. AI Studio에서 Live와 Extended Thinking를 같은 시나리오로 비교하고, 도구 호출 중에도 대화가 유지되는지, 언어 전환이 깨지지 않는지를 봅니다. 한국어·영어가 섞이는 지원 채널이라면 중간 전환 시나리오를 꼭 넣으세요.
첫 파일럿은 읽기 도구와 예약 조회처럼 되돌리기 쉬운 기능만 연결합니다.
TTS 캐릭터 음성 제품과는 결이 다릅니다. 9월 23일 나온 Gemini 3.8 Flash TTS는 목소리 설계용이고, Live 계열은 실시간 대화·에이전트용입니다. 제품 로드맵에 둘을 같은 칸에 넣지 마세요.
데모 영상에는 온보딩 안내, 체스, 스케치를 React 컴포넌트로 바꾸는 작업, 다단계 예약처럼 “말하면서 진행”하는 장면이 있습니다. 제품 데모이므로 우리 지연·정확도를 보장하지는 않지만, Live API가 노리는 사용 형태를 보여 줍니다.
마치며
Gemini 3.8 Live는 “더 자연스러운 음성”을 넘어, 말하면서 도구를 돌리는 에이전트 기본형을 넓힌 소식입니다. API·Studio 접근과 파일럿 시나리오 두세 개만 정해 두면 다음 주 실험이 가능합니다. 여러분 팀에서는 음성 에이전트를 어디에 먼저 붙이시겠습니까?
출처
- Google, Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking (2026년 9월 15일): https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/