제미나이가 목소리를 글로 바꿉니다 | DAKER 커뮤니티

Google이 2026년 8월 26일 Gemini 3.5 Transcribe를 공개했습니다. 음성을 글로 바꾸는 최신 음성·텍스트 모델이며, Android Rambler와 macOS Gemini 앱에 이미 쓰이고, Gemini API·AI Studio·Gemini Enterprise Agent Platform에서 공개 프리뷰로 열렸습니다.

제미나이가 목소리를 글로 바꿉니다

나온 것

1. 공식 소개는 speech-to-text입니다. Google Introducing Gemini 3.5 Transcribe는 이 모델을 정밀하고 지능적인 실시간 전사를 위한 최신 speech-to-text라고 적습니다. 배경 소음, 전문 용어, 말더듬 정리에서 기존 인식기가 약했던 지점을 겨냥해, 원본 오디오를 다듬어진 형식의 텍스트로 바로 바꾼다고 설명합니다.

2. 이미 제품 안에 들어가 있습니다. 같은 글은 Android의 Rambler와 macOS Gemini 앱의 새 음성 기능에 이 모델이 쓰이고 있다고 밝혔습니다. 개발자는 Gemini API(Google AI Studio)와 Gemini Enterprise Agent Platform에서 비슷한 능력을 붙일 수 있다고 적혀 있습니다. Chrome에는 곧 웹 입력 상자에 말로 입력하는 기능이 온다고 안내했습니다.

3. API는 실시간과 녹음본으로 나뉩니다. 실시간 스트리밍은 Live API의 gemini-3.5-transcribe-live로, 초 미만 지연의 양방향 스트림을 목표로 합니다. 녹음본·회의·통화 로그는 Interactions API의 gemini-3.5-transcribe로 처리하며, 화자 귀속과 단어 단위 타임스탬프를 제공합니다. 두 이름을 한 엔드포인트로 합쳐 쓰지 않습니다.

4. 공식 페이지에 적힌 숫자만 옮깁니다. Artificial Analysis 기준 평균 Word Error Rate는 스트리밍 4.0%, 비스트리밍 2.6%입니다. Chirp 3 대비 time to final transcription은 70% 개선이라고 적혀 있습니다. FLEURS 벤치마크의 상위 언어·로케일 집합에서는 스트리밍 5.50% WER, 비스트리밍 5.04% WER입니다. 이 네 줄 밖의 점수표를 여기서 만들지 않습니다.

5. 스마트 전사·어휘·언어·화자 기능이 목록에 있습니다. 자기 수정(“화요일—아니, 수요일”)을 처리하고, “음”“아” 같은 군더더기를 지우며, 텍스트를 자동 정리합니다. 사용자 제공 맞춤 어휘에 맞춰 전문 용어·고유 표기를 인식합니다. 85개 이상 언어를 자동 감지·전사하고 지역 억양을 다룬다고 적혀 있습니다. 녹음본에서는 최대 3명 화자를 구분하고, 3명 초과는 실험 지원입니다.

6. 함수 호출은 macOS Gemini 앱 기준으로 적혀 있습니다. 이미지 생성·파일 분석처럼 복잡한 일을 다른 Gemini 모델에 넘기는 함수 호출이 있으며, 현재는 Gemini macOS 앱에서 쓸 수 있다고 공식 글이 적습니다. API 일반 기능으로 단정하지 않습니다.

7. 어디에 열려 있는지도 글이 나눕니다. 개발자: Gemini API·Google AI Studio·Google Antigravity에서 공개 프리뷰. 기업: Gemini Enterprise Agent Platform에서 공개 프리뷰, Gemini Enterprise for Customer Experience에는 곧 제공. 일반 사용자: macOS Gemini 앱(영어), Android Rambler(일부 국가·언어), Chrome은 곧. Gboard Rambler는 말로 쓴 생각을 정리된 텍스트로 바꾸고, 음성으로 수정·맞춤법·문체 변경도 할 수 있다고 적혀 있습니다.

본문 도표

아닌 것

Chirp 3가 오늘 사라진다는 발표가 아닙니다. 공식 글은 3.5 Transcribe가 Chirp 3 대비 능력·WER·지연이 나아졌다고 적습니다. Chirp 3 종료 일정을 이 글에서 만들지 않습니다.

모든 언어·모든 국가에 동시에 열린 것도 아닙니다. Rambler는 일부 국가·언어, macOS Gemini 앱 안내는 영어, Chrome은 곧입니다. “전 세계 즉시”로 팀에 알리지 않습니다.

화자 구분 무제한도 아닙니다. 녹음본 기준 최대 3명이고, 그 이상은 실험입니다. 회의록 요구사항에 10명 화자 확정을 오늘 기본값으로 올리지 않습니다.

벤치마크 밖 숫자를 지어내지 않습니다. WER·70%·FLEURS 수치는 공식 페이지와 Artificial Analysis 인용으로 적힌 값입니다. 그 밖의 정확도·비용을 여기서 추정하지 않습니다.

오늘 할 일

첫째, 원문을 읽습니다. Google 공식 글(2026-08-26)에서 모델 이름, API 구분, 숫자, 제품 표면을 확인합니다.

둘째, 실시간과 녹음본 중 필요한 쪽을 고릅니다. 대화형 음성은 gemini-3.5-transcribe-live, 회의·통화 로그는 gemini-3.5-transcribe입니다. 한 파이프라인에 두 이름을 섞어 쓰지 않습니다.

셋째, AI Studio 공개 프리뷰에서 샘플 오디오를 돌려 봅니다. 맞춤 어휘가 필요한 용어 목록을 먼저 준비한 뒤 결과를 비교합니다. WER 숫자를 우리 도메인 점수로 바꾸지 말고, 우리 오디오로 다시 잽니다.

넷째, 기업 계정은 Enterprise Agent Platform 권한을 확인합니다. Customer Experience 쪽은 “곧”이므로, 오늘 일정에 확정 배포로 넣지 않습니다.

다섯째, 만든 결과는 링크로 남기십시오. DAKER에는 25만 빌더와 339+ 대회, 29억+ 규모의 기록이 쌓여 있습니다. 전사 데모나 자막 파이프라인을 공개 링크로 올리면 같은 모델을 검토하는 팀이 바로 열어 볼 수 있습니다. 배포가 제출입니다. 올린 링크가 제출입니다.

숫자와 제품 표면을 나누어 적습니다

WER 4.0%와 2.6%는 Artificial Analysis 평균값입니다. 공식 글이 인용한 값이며, 우리 콜센터·강의·방언 데이터에서의 점수가 아닙니다. 도입 검토서에는 공식 숫자를 “참고”로 두고, 우리 샘플 오디오로 다시 잰 표를 옆에 붙입니다. FLEURS 5.50%·5.04%도 상위 언어·로케일 집합 기준입니다. 전 언어 평균으로 바꾸어 쓰지 않습니다.

70%는 time to final transcription 개선입니다. Chirp 3 대비 최종 전사가 확정되기까지의 시간이 줄었다는 설명입니다. 인식 정확도가 70% 올랐다는 문장으로 바꾸지 않습니다. 지연과 정확도를 한 문장에 섞지 않습니다.

제품 표면마다 언어·국가 조건이 다릅니다. macOS Gemini 앱 안내는 영어, Rambler는 일부 국가·언어, Chrome은 곧, API는 공개 프리뷰입니다. “어디서나 바로 한국어 전사”로 팀에 알리지 않습니다. 오늘 쓸 표면을 하나 고르고, 그 표면의 조건을 메모 첫 줄에 적습니다.

화자 3명 제한을 회의 도구 요구사항에 먼저 반영합니다. 4명 이상 회의를 기본 시나리오로 올리면 실험 구간에 들어가게 됩니다. 정식 파이프라인이 필요하면 3명 이하로 쪼개거나, 실험 구간임을 명시합니다.

함수 호출은 macOS 앱 문장입니다. 공식 글은 다른 Gemini 모델에 일을 넘기는 기능을 macOS Gemini 앱에서 쓴다고 적습니다. API 공개 프리뷰 범위와 앱 기능을 같은 체크리스트에 넣지 않습니다.

한 페이지 요약

Google은 2026년 8월 26일 Gemini 3.5 Transcribe를 speech-to-text 모델로 공개했습니다. Android Rambler와 macOS Gemini 앱에 이미 쓰이고, Gemini API·AI Studio·Gemini Enterprise Agent Platform에서 공개 프리뷰입니다. Chrome에는 곧 웹 입력 상자에 말로 치는 기능이 온다고 적혀 있습니다. 실시간은 gemini-3.5-transcribe-live, 녹음본은 gemini-3.5-transcribe입니다. Artificial Analysis 기준 WER은 스트리밍 4.0%, 비스트리밍 2.6%입니다. Chirp 3 대비 time to final transcription은 70% 개선입니다. FLEURS 상위 언어·로케일에서는 스트리밍 5.50%, 비스트리밍 5.04% WER입니다. 언어는 85개 이상, 화자는 최대 3명(초과는 실험)입니다. 스마트 전사·맞춤 어휘·함수 호출(macOS 앱)이 목록에 있습니다. 원문은 Google 공식 블로그입니다. 공식 숫자 밖의 정확도·비용을 추정하지 않습니다. 우리 오디오로 다시 잰 표를 옆에 둡니다. 데모와 파이프라인은 공개 링크로 남깁니다. 그 링크가 제출입니다.

도입 검토서 템플릿을 짧게 적습니다. 첫 줄에 쓸 표면(API·Rambler·macOS 앱·Enterprise Agent Platform)을 고릅니다. 둘째 줄에 언어·국가 조건을 적습니다. 셋째 줄에 실시간인지 녹음본인지 적습니다. 넷째 줄에 우리 샘플 WER 또는 수작업 대조 결과를 적습니다. 다섯째 줄에 화자 수 요구가 3명 이하인지 적습니다. 이 다섯 줄이 없으면 공식 블로그 숫자만 있는 검토서가 됩니다. 공식 숫자는 참고이고, 제출물은 우리 오디오로 검증한 결과 링크입니다.

Antigravity·Gboard·AI Studio Build mode 언급도 원문 범위를 지킵니다. 공식 글은 화면 맥락과 채팅 기록을 허가 하에 쓰는 Antigravity, Gboard Rambler, AI Studio Build mode 음성 코딩을 소개합니다. 각 표면의 권한 동의 문장을 우리 보안 정책에 맞게 옮깁니다. 권한 동의 없이 화면 맥락을 켠다는 문장을 팀에 올리지 않습니다.

파트너·고객 인용은 참고만 합니다. 공식 글은 Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel, Vision Agents 등이 Live API로 음성 인터페이스를 붙인다고 적습니다. Vivo, Intellitek Health, Lingopal의 지연·정확도·언어 지원 피드백도 소개합니다. 이 이름들은 공식 글의 소개입니다. 우리 계약이나 벤치 결과가 아닙니다. 검토서에 파트너 이름을 실적처럼 옮겨 적지 않습니다.

출처: Google — Introducing Gemini 3.5 Transcribe (2026-08-26)