話して頼めば裏で仕事が進む構造が標準になった
OpenAIは9月23日(現地時間)、X公式アカウントで、ChatGPTの音声モードがメール・カレンダー・Slackなどのプラグインを使えるようになったと発表した。プラグインはAIアシスタントに外部サービスをつなぐ部品だ。音声モードでもGPT-6 Astra・Sol・Lunaを選べ、ウェブとモバイルのChatGPT Workでは話すだけで文書・スライド・サイト・スプレッドシートを作ったり、ブラウザ作業を任せたりできる。最新版アプリから世界で順次提供される。
開発者側も同じ方向だ。OpenAIの開発者ドキュメントによると、音声モデルGPT-Liveは会話だけを担当し、情報の検索やツールの使用といった実際の仕事は後ろにいるエージェントに渡す。エージェントとは、目標を受け取って複数の手順を自分で進めるAIプログラムだ。話しながらでも聞けるため、注文状況を確認している間にユーザーが条件を付け足しても会話は途切れない。音声セッションは秒単位で課金され、裏で動くモデルの利用料は別にかかる。
Metaも9月23日(現地時間)のConnect 2026で、個人エージェントMuseを今後数か月のうちにAIメガネに搭載すると発表した。メガネをかけたまま名前を呼べば、目の前の商品やチラシを見て処理し、音声モードでは会話しながら裏で作業を続ける。買い物にはウォルマート・ベストバイ・セフォラなどとShop Pay・PayPal決済が、仕事にはNotion・GitHub・Boxがつながり、Museは自分のメールアドレスも持つ。
GoogleのLive Avatarも、会話を続けながら裏でツールを呼び出す非同期方式を使う。4社とも、話す窓口と働くエンジンを分けた。ユーザーは話しかけ、仕事は裏でエージェントがこなす。
声と顔を作るコストが下がった

Googleは9月23日(現地時間)、音声合成モデルGemini 3.8 Flash TTSと、大量処理向けのFlash-Lite TTSを公開した。TTSは文字を読み上げる技術だ。2,000種類以上の既成の声から選んだり、言葉で説明して新しい声を作ったりでき、一文ごとに感情・速さ・笑い声などの演技指示を付けられる。GoogleはHume AIの音声デザイン評価で71.4点を記録し1位になったとしている。
注目すべきは複製だ。30秒の録音で声を複製するが、声の持ち主が自ら録音した同意音声が参照音声と一致しなければ作成されない。生成音声には人の耳には聞こえないSynthIDの透かしと、出所表示の規格であるC2PAの情報が入る。AI Studioの声の複製は、イリノイ州・テキサス州・欧州経済領域・英国・スイス・インドでは使えない。
翌日の9月24日(現地時間)には、Gemini 3.8 Liveに話す顔を付けたLive AvatarがGemini Enterpriseで提供された。97言語を行き来しながら口の動きと表情を合わせ、参照画像から作るカスタムアバターは許可を受けた企業にのみ開放されている。同じ23日、GoogleはGoogleアカウントがあれば誰でもGoogle Vidsで新しい動画モデルOmni 1.1 Flashを使い、1080pの動画を無料で作れるようにした。より多く作るには有料プランが必要だ。
YouTubeはMade on YouTubeイベントの機能一覧で、ライブ配信をリアルタイムで他の言語の音声に置き換えるAuto Dubbing for Liveを予告した。来年初めに英語とスペイン語から限定的に提供する。同じ一覧には、自分の顔や声を無断で使ったAI動画を見つけて削除するLikeness detectionもある。声と顔を作る道具と守る道具が同じ週にそろって出た。
オフィス側:Copilotはアプリを作り、代わりに待つ

Microsoftは9月25日(現地時間)、公式ブログでCopilotにHome・Code・Autopilotを加えると発表した。Homeは短い会話(Chat)と最後まで任せる委任作業(Cowork)を一か所にまとめ、Word・Excel・PowerPointの文書をその中で直接作成・編集できるようにする。
Codeは説明するだけで、ダッシュボード・トラッカー・自動化ツールといった小さなアプリを作る。GitHub Copilotと同じ技術を使い、隔離された環境で動かして会社のテナント内にホストできる。テナントとは会社ごとに分かれた専用の空間だ。Autopilotは旧名Scoutのエージェントで、名前・役割・目標を与えると、チャンネルを見守り、フォローアップを行い、数日後に仕事を再開する。
料金体系も合わせて変わった。日常的な回答・下書き・要約はユーザーごとの定額料金の範囲で使い、Cowork・Code・AutopilotとAstra・Fableといった最上位モデルは従量課金で動く。HomeとCodeは早期アクセスプログラムFrontierで数週間以内に、Autopilotは今月末に非公開プレビューで提供される。エージェントが長く働くほど、費用も長く積み上がるということだ。
デバイスとインフラ側:メガネが入口になり、電力は宇宙まで探しに行く
MetaはConnect 2026で、重さ約100グラムのMeta VR Glassesを発表した。Metaはトランプ一組ほどの重さだと説明し、IMAX Enhanced認証を受けた初のVRデバイスで、年間100件以上のスポーツ中継を没入型で見せると述べた。価格と発売日は発表に含まれていない。イヤホン機能を備えたRay-Ban Meta AudioとRay-Ban Meta(第3世代)も登場した。
MetaのAIメガネには、FDAの認可を受けた聴力補助ソフトウェアが入る。軽度から中等度の難聴を自覚する成人が、通院や処方なしに自宅で数分で設定する方式で、今年中に米国で149.99ドルの追加購入またはMeta Oneサブスクリプションで使える。Metaは年末までにAIメガネを100種類以上そろえるとしている。
Googleは9月24日(現地時間)、AIチップTPUを搭載した試験衛星をSpaceXの相乗り打ち上げTransporter-18で軌道に投入すると発表した。宇宙にAIの計算設備を置けるかを探るProject Suncatcherの最初の実験で、衛星企業Planetと共同で開発した。低軌道の衛星は地上より最大8倍多い太陽光電力を得られる。地上の放射線試験でTrillium TPUは5年間のミッションで受ける量を超える放射線に耐え、2027年には衛星2基をレーザーでつなぐ試験を行う。
推薦と判定の分野でも言葉が入力になった。Spotifyは9月23日(現地時間)、自分の好みの要約を見せて文章で修正できるTaste Profileを、米国の18歳以上のPremium利用者にベータ版として公開した。TechCrunchは9月18日、文章ではなく確率を返す判定モデルJevが開発者の関心を集めていると報じ、Vercelがコマンドの安全性分類器をJevに切り替えて5〜18倍速い結果を得た事例を伝えた。
使う側が確認すべき三つのこと
第一に、音声に開いた権限だ。話してメールを送ったり予定を変えたりした瞬間、聞き間違えた一言がそのまま実行になる。音声モードにどのプラグインがつながっているか、送信前に確認を求める設定がオンになっているかをまず確かめる。
第二に、声と顔の同意だ。Googleは複製に本人の同意録音を求め、YouTubeは無断使用を見つけて削除する道具を出した。会社の広報や研修動画に経営者や社員の声を使う予定なら、誰がいつ同意したかの記録を先に残す。
第三に、料金が発生する場所だ。Microsoftは長時間動くエージェント作業を従量課金に分け、OpenAIのGPT-Liveも音声は秒単位、裏のモデルは別に課金する。導入前に1か月分の利用を小さく見積もって試し、予算の上限を先に決めておく。
| 確認項目 | 今週の発表で見た根拠 | 最初にやること |
|---|---|---|
| 音声に開いた権限 | ChatGPT音声モードのメール・カレンダー・Slackプラグイン、メガネのMuse | 接続中のプラグインと実行前確認の設定を点検 |
| 声と顔の同意 | Gemini TTSの同意録音の要求、YouTubeのLikeness detection | 誰がいつ同意したかを記録 |
| 従量課金 | CopilotのCowork・Code・Autopilot、GPT-Liveの秒単位課金 | 小規模な試用と予算上限の設定 |
