goose 1.52 - OSSエージェントgoose 1.52公開。音声で話しかけて作業を任せられるように anchor left anchor right

Sep 24 2026 AIニュース

OSSエージェントgoose 1.52公開。音声で話しかけて作業を任せられるように

anchor left anchor right

goose 1.52は、オープンソースのAIエージェントgooseが2026年9月23日に公開した版で、デスクトップアプリに音声会話モードが加わりました。

📖 この記事で分かること

  • goose 1.52.0で音声会話モードが加わった
  • 作業は音声モデルから本体エージェントに渡される
  • Opus 5.5やGPT-6系など新モデルに対応した
  • レシピや拡張機能まわりの安全策も強化された

💡 知っておきたい用語

  • goose:ファイル編集やコマンド実行まで自分でこなすオープンソースのAIエージェント。好きなLLMを後ろに付け替えて使える「汎用の作業代行役」

最終更新日: 2026年9月24日

▶ 公式ページ

goose 1.52 - OSSエージェントgoose 1.52公開。音声で話しかけて作業を任せられるように

goose 1.52.0で何が変わったか

この記事のポイント

  • オープンソースのAIエージェント「goose」がv1.52.0(2026年9月時点)を2026年9月23日に公開しました。
  • デスクトップアプリに音声でリアルタイムに会話する「Live voice」を追加しました(任意で有効化)。
  • Opus 5.5・GPT-6-sol・GPT-6-lunaへの対応と、レシピまわりの安全策も加わりました。

gooseは、コードの提案にとどまらず、ツールの導入・実行・編集・テストまでを任意のLLMで行うオープンソースのAIエージェントです。ライセンスはApache-2.0で、GitHubのスターは約5.4万(2026年9月時点)。リポジトリは現在aaif-goose組織の下にあり、旧URLのblock/gooseから転送されます。

今回のv1.52.0は、米国時間9月23日に公開されました。リリースノートの目玉は、デスクトップアプリの音声会話モードです。

音声会話「Live voice」の仕組み

話し相手は音声モデル、実作業は本体のエージェント、という分業になっています。追加時のプルリクエストによると、流れは次のとおりです。

  • チャット設定からLive voiceを有効にし、ホーム画面か既存のセッションから通話を始める
  • 通話中はマイクのミュート・解除ができ、いつでも終了できる
  • ツール実行や深い推論が要る依頼は、音声モデルがメインのgooseエージェントに委譲する
  • 委譲した結果は、そのまま通話中の会話に戻ってくる
  • 文字起こしは通話中に表示され、セッションに保存される。通話後もテキストで続きを進められる

初期実装はOpenAIのgpt-live-1モデル(2026年9月時点)をWebRTC経由で使います。内部はデスクトップからACP(エージェントとクライアントをつなぐプロトコル)を通じて音声サービスに接続し、音声プロバイダを差し替えられる設計です。料金、OSごとの差、日本語音声への対応は公式に記載がなく、不明です。

その他の主な変更

音声以外では、モデル対応の拡充と安全面の手当てが中心です。

  • 新モデル対応: Opus 5.5、GPT-6-sol、GPT-6-luna(PR #12447)
  • Z.AIのCoding Planをプロバイダとして追加。ツール呼び出しのストリーミングに対応
  • OpenRouterとJevを実装した「decisions provider」を追加
  • SDKのOpenAIプロバイダで、接続先URLを変更可能に
  • レシピのパラメータに上限を設定(最大32個、選択肢200個、128KiB)
  • レシピが拡張機能を起動する前に、利用者の同意を必須化
  • 外部と通信するTCPブリッジを明示的な有効化制に変更、カスタムプロバイダの設定ファイルを保護
  • 非対応のmacOSへの更新を防止、設定画面をフルスクリーン表示に刷新

編集部の見方

音声は「窓口」、作業は「本体」という分け方: 音声モデルに全部をやらせず、重い処理を本体エージェントへ渡す構成は、応答の速さと作業の確実さを両立させる現実的な設計です。会話の記録がセッションに残り、テキストに戻って続けられる点も、作業ログを重視する開発者には扱いやすいはずです。

初期段階であることは前提に: 音声側は現時点でOpenAIのモデル1種に依存しています。差し替え可能な設計とはいえ、他社の音声モデルがいつ使えるかは示されていません。ローカルLLMだけで運用している人にとって、音声モードはまだ選択肢になりにくいと見ています。

安全策の追加は地味だが重要: レシピによる拡張機能の起動に同意を求める変更や、外部通信の既定オフ化は、エージェントに端末操作を任せるうえでの事故を減らします。チームでレシピを共有している場合は、更新後に挙動が変わる箇所として確認しておく価値があります。


よくある質問

Q: Live voiceは最初から有効になっていますか?

A: いいえ。チャット設定から自分で有効にする任意の機能です。

Q: 音声会話にはどのモデルが使われますか?

A: 初期実装ではOpenAIのgpt-live-1をWebRTC経由で使います。料金や日本語音声への対応は公式に記載がありません。

Q: CLIでも音声会話は使えますか?

A: 今回追加されたのはデスクトップアプリ向けの機能です。


まとめ

goose v1.52.0は、デスクトップアプリに音声会話モードを加え、話しかけた依頼を本体エージェントが実行する形を取りました。あわせてOpus 5.5やGPT-6系への対応、レシピと拡張機能の安全策が入っています。音声側は1つのモデルに依存する初期段階のため、今後の対応プロバイダの広がりが実用性を左右します。


【用語解説】

  • WebRTC: ブラウザやアプリ同士で音声・映像をリアルタイムにやり取りするための標準技術。
  • レシピ: gooseで手順や設定をまとめて再利用・共有できる定義ファイル。
  • ACP【エーシーピー】: エディタやアプリとAIエージェントをつなぐための通信の取り決め。

引用元:


この記事について: AI 支援で執筆、編集部が事実確認・編集しています。誤りや追加情報があれば Contact よりお知らせください。

anchor left anchor right
KOJI TANEMURA

15 年以上の開発経験を持つソフトウェアエンジニア / テクノロジーライター。AI エージェントの実務活用を研究し、現場や経営者向けセミナーでその知見を発信。本メディア tech-noisy.com では、一次情報に基づく最新ニュース・解説記事を執筆。また、音楽生成 AI による DJ パフォーマンスを企業イベントで行うなど、テクノロジーと表現の融合も探求している。