goose 1.52は、オープンソースのAIエージェントgooseが2026年9月23日に公開した版で、デスクトップアプリに音声会話モードが加わりました。
📖 この記事で分かること
- goose 1.52.0で音声会話モードが加わった
- 作業は音声モデルから本体エージェントに渡される
- Opus 5.5やGPT-6系など新モデルに対応した
- レシピや拡張機能まわりの安全策も強化された
💡 知っておきたい用語
- goose:ファイル編集やコマンド実行まで自分でこなすオープンソースのAIエージェント。好きなLLMを後ろに付け替えて使える「汎用の作業代行役」
最終更新日: 2026年9月24日
▶ 公式ページ
- goose v1.52.0 リリースノート(GitHub)
- goose リポジトリ(GitHub)

goose 1.52.0で何が変わったか
この記事のポイント
- オープンソースのAIエージェント「goose」がv1.52.0(2026年9月時点)を2026年9月23日に公開しました。
- デスクトップアプリに音声でリアルタイムに会話する「Live voice」を追加しました(任意で有効化)。
- Opus 5.5・GPT-6-sol・GPT-6-lunaへの対応と、レシピまわりの安全策も加わりました。
gooseは、コードの提案にとどまらず、ツールの導入・実行・編集・テストまでを任意のLLMで行うオープンソースのAIエージェントです。ライセンスはApache-2.0で、GitHubのスターは約5.4万(2026年9月時点)。リポジトリは現在aaif-goose組織の下にあり、旧URLのblock/gooseから転送されます。
今回のv1.52.0は、米国時間9月23日に公開されました。リリースノートの目玉は、デスクトップアプリの音声会話モードです。
音声会話「Live voice」の仕組み
話し相手は音声モデル、実作業は本体のエージェント、という分業になっています。追加時のプルリクエストによると、流れは次のとおりです。
- チャット設定からLive voiceを有効にし、ホーム画面か既存のセッションから通話を始める
- 通話中はマイクのミュート・解除ができ、いつでも終了できる
- ツール実行や深い推論が要る依頼は、音声モデルがメインのgooseエージェントに委譲する
- 委譲した結果は、そのまま通話中の会話に戻ってくる
- 文字起こしは通話中に表示され、セッションに保存される。通話後もテキストで続きを進められる
初期実装はOpenAIのgpt-live-1モデル(2026年9月時点)をWebRTC経由で使います。内部はデスクトップからACP(エージェントとクライアントをつなぐプロトコル)を通じて音声サービスに接続し、音声プロバイダを差し替えられる設計です。料金、OSごとの差、日本語音声への対応は公式に記載がなく、不明です。
その他の主な変更
音声以外では、モデル対応の拡充と安全面の手当てが中心です。
- 新モデル対応: Opus 5.5、GPT-6-sol、GPT-6-luna(PR #12447)
- Z.AIのCoding Planをプロバイダとして追加。ツール呼び出しのストリーミングに対応
- OpenRouterとJevを実装した「decisions provider」を追加
- SDKのOpenAIプロバイダで、接続先URLを変更可能に
- レシピのパラメータに上限を設定(最大32個、選択肢200個、128KiB)
- レシピが拡張機能を起動する前に、利用者の同意を必須化
- 外部と通信するTCPブリッジを明示的な有効化制に変更、カスタムプロバイダの設定ファイルを保護
- 非対応のmacOSへの更新を防止、設定画面をフルスクリーン表示に刷新
編集部の見方
音声は「窓口」、作業は「本体」という分け方: 音声モデルに全部をやらせず、重い処理を本体エージェントへ渡す構成は、応答の速さと作業の確実さを両立させる現実的な設計です。会話の記録がセッションに残り、テキストに戻って続けられる点も、作業ログを重視する開発者には扱いやすいはずです。
初期段階であることは前提に: 音声側は現時点でOpenAIのモデル1種に依存しています。差し替え可能な設計とはいえ、他社の音声モデルがいつ使えるかは示されていません。ローカルLLMだけで運用している人にとって、音声モードはまだ選択肢になりにくいと見ています。
安全策の追加は地味だが重要: レシピによる拡張機能の起動に同意を求める変更や、外部通信の既定オフ化は、エージェントに端末操作を任せるうえでの事故を減らします。チームでレシピを共有している場合は、更新後に挙動が変わる箇所として確認しておく価値があります。
よくある質問
Q: Live voiceは最初から有効になっていますか?
A: いいえ。チャット設定から自分で有効にする任意の機能です。
Q: 音声会話にはどのモデルが使われますか?
A: 初期実装ではOpenAIのgpt-live-1をWebRTC経由で使います。料金や日本語音声への対応は公式に記載がありません。
Q: CLIでも音声会話は使えますか?
A: 今回追加されたのはデスクトップアプリ向けの機能です。
まとめ
goose v1.52.0は、デスクトップアプリに音声会話モードを加え、話しかけた依頼を本体エージェントが実行する形を取りました。あわせてOpus 5.5やGPT-6系への対応、レシピと拡張機能の安全策が入っています。音声側は1つのモデルに依存する初期段階のため、今後の対応プロバイダの広がりが実用性を左右します。
【用語解説】
- WebRTC: ブラウザやアプリ同士で音声・映像をリアルタイムにやり取りするための標準技術。
- レシピ: gooseで手順や設定をまとめて再利用・共有できる定義ファイル。
- ACP【エーシーピー】: エディタやアプリとAIエージェントをつなぐための通信の取り決め。
引用元:
- [1] goose v1.52.0 リリースノート(GitHub)
- [2] feat: add Live voice conversations to the desktop app (#12093)(GitHub)
- [3] support Opus 5.5, GPT-6-{sol,luna} (#12447)(GitHub)
この記事について: AI 支援で執筆、編集部が事実確認・編集しています。誤りや追加情報があれば Contact よりお知らせください。
Previous Post
llama.cpp 0.5.0公開。サーバが複数アドレスで待ち受け、関数呼び出しで画像も返せる
Next Post
生成AIニュース 昨日【2026年9月24日(木)】のAI公式発表を3分でチェック
15 年以上の開発経験を持つソフトウェアエンジニア / テクノロジーライター。AI エージェントの実務活用を研究し、現場や経営者向けセミナーでその知見を発信。本メディア tech-noisy.com では、一次情報に基づく最新ニュース・解説記事を執筆。また、音楽生成 AI による DJ パフォーマンスを企業イベントで行うなど、テクノロジーと表現の融合も探求している。