말로 시키면 뒤에서 일하는 구조가 기본이 됐다
오픈AI는 9월 23일(현지시간) X 공식 계정에서 ChatGPT 음성 모드가 이메일·캘린더·Slack 같은 플러그인을 쓸 수 있게 됐다고 밝혔다. 플러그인은 AI 비서에 바깥 서비스를 연결하는 부품이다. 음성 모드에서도 GPT-6 Astra·Sol·Luna를 고를 수 있고, 웹과 모바일의 ChatGPT Work에서는 말만으로 문서·슬라이드·사이트·스프레드시트를 만들거나 브라우저 작업을 맡길 수 있다. 최신 앱 버전부터 전 세계에 순차 적용된다.
개발자 쪽도 같은 방향이다. 오픈AI 개발자 문서에 따르면 음성 모델 GPT-Live는 대화만 맡고, 정보 조회나 도구 사용 같은 실제 일은 뒤에 있는 에이전트에 넘긴다. 에이전트는 목표를 받아 여러 단계를 스스로 처리하는 AI 프로그램이다. 사용자가 말하는 동안에도 들을 수 있어서, 주문 상태를 확인하는 사이 사용자가 조건을 덧붙여도 대화가 끊기지 않는다. 음성 세션은 초 단위로 과금되고, 뒤에서 도는 모델 사용료는 따로 붙는다.
메타도 9월 23일(현지시간) Connect 2026에서 개인 에이전트 Muse를 앞으로 몇 달 안에 AI 안경에 넣겠다고 밝혔다. 안경을 쓴 채 이름을 부르면 눈앞의 상품이나 전단을 보고 일을 처리하고, 음성 모드에서는 대화하는 동안 뒤에서 작업을 이어 간다. 쇼핑에는 월마트·베스트바이·세포라 등과 Shop Pay·PayPal 결제가, 업무에는 Notion·GitHub·Box가 연결되고, Muse는 자기 이메일 주소도 받는다.
구글의 Live Avatar도 대화를 이어 가면서 뒤에서 도구를 부르는 비동기 방식을 쓴다. 네 회사 모두 말하는 창구와 일하는 엔진을 나눴다. 사용자는 말을 걸고, 일은 뒤에서 에이전트가 한다.
목소리와 얼굴을 만드는 비용이 내려갔다

구글은 9월 23일(현지시간) 음성 합성 모델 Gemini 3.8 Flash TTS와 대량 처리용 Flash-Lite TTS를 냈다. TTS는 글을 소리 내어 읽어 주는 기술이다. 기성 목소리 2,000개 넘게에서 고르거나 말로 설명해 새 목소리를 만들고, 문장마다 감정·속도·웃음 같은 연기 지시를 붙일 수 있다. 구글은 Hume AI의 음성 디자인 평가에서 71.4점으로 1위를 했다고 밝혔다.
눈여겨볼 대목은 복제다. 30초 녹음으로 목소리를 복제하지만, 목소리 주인이 직접 녹음한 동의 음성이 참조 음성과 일치해야 만들어진다. 생성된 음성에는 사람 귀에는 안 들리는 SynthID 워터마크와 출처 표시 규격인 C2PA 정보가 들어간다. AI Studio의 복제 기능은 일리노이·텍사스·유럽경제지역·영국·스위스·인도에서는 쓸 수 없다.
다음 날인 9월 24일(현지시간)에는 Gemini 3.8 Live에 말하는 얼굴을 붙인 Live Avatar가 Gemini Enterprise에 나왔다. 97개 언어를 오가며 입 모양과 표정을 맞추고, 참조 이미지로 만드는 맞춤 아바타는 허가받은 기업에만 열려 있다. 같은 23일 구글은 Google Vids에서 누구나 구글 계정으로 새 영상 모델 Omni 1.1 Flash를 써 1080p 영상을 비용 없이 만들게 했다. 더 많이 만들려면 유료 요금제가 필요하다.
유튜브는 Made on YouTube 행사 기능 목록에서 라이브 방송을 실시간으로 다른 언어 음성으로 옮기는 Auto Dubbing for Live를 예고했다. 내년 초 영어·스페인어부터 제한적으로 연다. 같은 목록에는 내 얼굴과 목소리를 무단으로 쓴 AI 영상을 찾아 내리는 Likeness detection이 있다. 목소리와 얼굴을 만드는 도구와 지키는 도구가 한 주에 같이 나왔다.
사무실 쪽: Copilot은 앱을 만들고 대신 기다린다

마이크로소프트는 9월 25일(현지시간) 공식 블로그에서 Copilot에 Home·Code·Autopilot을 넣는다고 발표했다. Home은 짧은 대화(Chat)와 끝까지 맡기는 위임 작업(Cowork)을 한곳에 모으고, Word·Excel·PowerPoint 문서를 그 안에서 바로 만들고 고치게 한다.
Code는 말로 설명하면 대시보드·추적표·자동화 도구 같은 작은 앱을 만들어 준다. GitHub Copilot과 같은 기술을 쓰고, 격리된 환경에서 돌려 회사 테넌트 안에 올릴 수 있다. 테넌트는 회사별로 나뉜 전용 공간이다. Autopilot은 옛 이름이 Scout인 에이전트로, 이름·역할·목표를 주면 채널을 지켜보고 후속 연락을 챙기며 며칠 뒤 일을 다시 잡는다.
요금 구조가 함께 바뀌었다. 일상적인 답변·초안·요약은 사용자당 고정 요금 안에서 쓰고, Cowork·Code·Autopilot과 Astra·Fable 같은 최상위 모델은 쓴 만큼 내는 요금으로 돈다. Home·Code는 얼리 액세스 프로그램(Frontier)에서 몇 주 안에, Autopilot은 이달 말 비공개 프리뷰로 간다. 에이전트가 오래 일할수록 비용도 오래 쌓인다는 뜻이다.
기기와 인프라 쪽: 안경이 입구가 되고 전력은 우주까지 찾는다
메타는 Connect 2026에서 무게 약 100그램의 Meta VR Glasses를 공개했다. 메타는 카드 한 벌 무게라고 설명했고, IMAX Enhanced 인증을 받은 첫 VR 기기이며 스포츠 생중계를 해마다 100건 넘게 몰입형으로 보여 준다고 밝혔다. 가격과 출시일은 발표에 없다. 이어폰 기능을 담은 Ray-Ban Meta Audio와 Ray-Ban Meta 3세대도 나왔다.
메타 AI 안경에는 FDA 허가를 받은 청력 보조 소프트웨어가 들어간다. 스스로 가벼운~중간 정도 난청을 느끼는 성인이 병원 방문이나 처방 없이 집에서 몇 분 만에 설정하는 방식이고, 올해 안에 미국에서 149.99달러 추가 구매나 Meta One 구독으로 쓴다. 메타는 올해 말까지 AI 안경을 100종 넘게 갖추겠다고 했다.
구글은 9월 24일(현지시간) AI 칩 TPU를 실은 시험 위성을 SpaceX의 합승 발사 Transporter-18로 올린다고 밝혔다. 우주에 AI 연산 설비를 둘 수 있는지 보는 Project Suncatcher의 첫 실험이고, 위성 기업 Planet과 함께 만들었다. 저궤도 위성은 지상보다 최대 8배 많은 태양광 전력을 얻는다. 지상 방사선 시험에서 Trillium TPU는 5년 임무에서 받을 양보다 많은 방사선을 견뎠고, 2027년에는 위성 두 대를 레이저로 잇는 시험을 한다.
추천과 판정 쪽에서도 말이 입력이 됐다. 스포티파이는 9월 23일(현지시간) 내 취향 요약을 보여 주고 글로 고치게 하는 Taste Profile을 미국의 18세 이상 프리미엄 이용자에게 베타로 열었다. TechCrunch는 9월 18일 문장 대신 확률을 내놓는 판정 모델 Jev가 개발자 사이에서 관심을 모은다고 보도했고, Vercel이 명령 안전 분류기를 Jev로 바꿔 5~18배 빠른 결과를 얻었다는 사례를 전했다.
쓰는 쪽이 챙길 세 가지
첫째, 음성에 연 권한이다. 말로 메일을 보내고 일정을 바꾸는 순간, 잘못 알아들은 한마디가 곧 실행이 된다. 음성 모드에 어떤 플러그인이 연결돼 있는지, 보내기 전에 확인을 받는 설정이 켜져 있는지부터 본다.
둘째, 목소리와 얼굴의 동의다. 구글은 복제에 본인 동의 녹음을 요구했고 유튜브는 무단 사용을 찾아 내리는 도구를 냈다. 회사 홍보나 교육 영상에 대표나 직원의 목소리를 쓸 계획이라면, 누가 언제 동의했는지 기록부터 남긴다.
셋째, 요금이 붙는 자리다. 마이크로소프트는 오래 도는 에이전트 작업을 쓴 만큼 내는 요금으로 뺐고, 오픈AI의 GPT-Live도 음성은 초 단위, 뒤의 모델은 따로 과금한다. 도입 전에 한 달 사용량을 작게 잡아 시험해 보고, 예산 상한을 먼저 정해 둔다.
| 점검 항목 | 이번 주 발표에서 본 근거 | 먼저 할 일 |
|---|---|---|
| 음성에 연 권한 | ChatGPT 음성 모드의 이메일·캘린더·Slack 플러그인, 안경의 Muse | 연결된 플러그인 목록과 실행 전 확인 설정 점검 |
| 목소리·얼굴 동의 | Gemini TTS의 동의 녹음 요구, 유튜브 Likeness detection | 누가 언제 동의했는지 기록 |
| 쓴 만큼 내는 요금 | Copilot Cowork·Code·Autopilot, GPT-Live 초 단위 과금 | 작은 규모 시험과 예산 상한 설정 |
