구글이 Gemini 3.8 Live와 3.8 Live Extended Thinking을 공개하고 캐스케이드 음성 파이프라인을 정면으로 겨냥했습니다#
9월 15일 공개: 두 모델 모두 네이티브 음성-대-음성 모델이고, Gemini Live API와 AI Studio에서 오늘부터 쓸 수 있습니다. Google
가격은 분당 과금입니다: 오디오 입력 $0.005/분, 오디오 출력 $0.018/분입니다. 10분 통화면 입력 $0.05에 출력 $0.18을 더해 $0.23, 60분이면 $1.38입니다. Gemini API pricing
비동기 함수 호출이 이번 릴리스의 중심입니다: 도구 호출은 백그라운드에서 돌고 오디오 응답은 계속 스트리밍됩니다. 구글은 ASR, LLM, TTS를 이어 붙인 캐스케이드 구조의 대안으로 두 모델을 배치했습니다. Google for Developers
Live API가 함께 여는 것들: 실시간 시각 입력, 확인 코드와 청구 번호 같은 영숫자 정밀도, 97개 언어 전환, 구조화 데이터와 실시간 오디오 병합입니다. Extended Thinking은 말하면서 백그라운드로 추론하고 “확인해볼게요” 같은 초기 신호를 먼저 냅니다.
벤치마크 숫자: 3.8 Live Extended Thinking이 Artificial Analysis 음성-대-음성 품질 지수에서 82.6으로 1위, τ-Voice 68.6%, τ-Voice-banking 35.1%, Big Bench Audio 97.7%를 기록했습니다. MarkTechPost
호스팅 전용입니다: 오픈 웨이트가 아니어서 직접 띄우는 선택지는 없습니다. LiveKit, Pipecat, Vercel, Agora 같은 스트리밍 파트너를 거쳐 붙일 수 있고, 9to5Google은 같은 모델이 Gemini Live와 Gmail에도 들어간다고 전했습니다. 9to5Google