Product
@OpenAIDevs
OpenAI、音声エージェント向けモデル GPT-Live-1 を API で提供開始
OpenAI は GPT-Live-1 を API で利用可能にしました。ChatGPT の自然な会話のやり取りを自分のアプリに持ち込めるもので、話しながら同時に聞き取れる音声エージェントを作れます。組み合わせるモデルやハーネスは開発者側で選べるとしています。
メモ
「話しながら聞く」全二重の音声モデルが API として出てきた点がポイントです。音声レイヤーと推論モデルを分けて選べる構成なので、既存のエージェント実装の上に音声 UI を足す形で試せそうです。
出典 @OpenAIDevs↗
AI Agents
@OpenAIDevs
OpenAI、Codex ハーネスでクラウドエージェントを動かす Agents API をパブリックベータで公開
OpenAI は Agents API をパブリックベータとして公開しました。Codex ハーネスを使ったクラウドエージェントを構築・実行でき、実行環境は OpenAI が完全管理します。オーケストレーション、長時間セッション、コンテキスト管理は OpenAI 側が担い、開発者はエージェント固有の部分に集中できるとしています。エージェントループは OpenAI のインフラ上で回り、能力の制御や、コードを実行しファイルを扱う場所の選択は開発者側に残るという説明です。
メモ
Anthropic の Claude Managed Agents と同じ「エージェントループをマネージドで提供する」路線です。ハーネスの中身が Codex 固定になるので、自前のループを持っている場合はどこまで置き換えられるかを見比べたいところです。
出典 @OpenAIDevs↗
AI Agents
@ClaudeDevs
Claude Managed Agents に ant CLI のセッションビューアと auto モードが追加
Claude Managed Agents に2つの更新が入りました。1つ目は ant CLI のセッションビューアで、ant beta:sessions connect で実行中のセッションにターミナルを接続でき、--web を付けると localhost から Web UI を開けます。2つ目は auto モードで、Claude が user.message イベントに書かれた意図をもとに各ツール呼び出しをレビューし、実行するか、拒否するか、ユーザーに確認するかを判断します。
メモ
マネージド環境で動くエージェントの「中を覗く」手段と、ツール呼び出しの許可判断を自動化する仕組みが同時に来た形です。auto モードは意図の書き方が判断精度に直結するので、user.message にどこまで書くかが運用のコツになりそうです。
出典 @ClaudeDevs↗
Product
@ClaudeDevs
Claude Code デスクトップアプリ、任意のペインを別ウィンドウに切り離し可能に
Claude Code のデスクトップアプリで、任意のペインを独立したウィンドウとしてポップアウトできるようになりました。diff やターミナルを2つ目の画面にドラッグして、メインウィンドウで Claude が作業を続ける間も別画面で確認でき、いつでも元の位置に戻せます。セッションを左右に並べたり、上下に積んだりする表示も可能です。
メモ
複数セッションを並行して走らせる使い方が前提になってきた印象です。diff を別モニターに常駐させておくと、レビューしながら次の指示を出す流れが作りやすくなります。
出典 @ClaudeDevs↗
Benchmark
@OpenAIDevs
GPT-Live-1 のベンチマーク: タスク完了・ターンテイキング・応答速度・ツール利用で評価
OpenAI は GPT-Live-1 の評価結果を公開しました。本番の音声エージェントで重要になる指標として、タスク完了率、会話のやり取りとターンテイキング、応答の速さ、ツール利用の4点に絞って測っています。タスク完了については Tau3 を使い、航空・小売・通信のカスタマーサポート業務を音声エージェントが実際にこなせるかを検証しました。GPT-6 Astra(reasoning effort は medium)と組み合わせた構成で、初回試行でのタスク完了率は 83.6% だったとしています。
メモ
音声モデルの評価軸を「賢さ」ではなく「ターンの取り方」や「応答までの時間」に置いているのが実務寄りです。自前で音声エージェントを評価するときの項目設計の参考になります。
出典 @OpenAIDevs↗
Product
@GoogleAI
Google、Nano Banana ベースの画像生成・編集ツール「Google Pics」を発表
Google は Nano Banana を基盤にした画像ツール Google Pics を発表しました。画像の生成、修正、共同制作を高い精度で行えるとしています。挙げられている機能は、画像の他の部分を変えずに特定のオブジェクトだけを切り出して編集すること、画像内のテキストを修正または翻訳することなどです。
メモ
「オブジェクト単位の局所編集」と「画像内テキストの翻訳」は、モデル単体では扱いにくかった操作です。Nano Banana をどう UI に落とし込んだかは、画像生成をプロダクトに組み込む際の参考になります。
出典 @GoogleAI↗
Open Models
@_akhaliq
音声生成・編集のオープンソース基盤モデル「AuK」のテクニカルレポートが公開
音声の生成と編集を対象としたオープンソースの基盤モデル AuK のテクニカルレポートが公開されました。論文は Hugging Face Papers 上で読めます。
メモ
音声モデルは商用 API が先行しがちな領域なので、生成と編集の両方をカバーするオープンな基盤モデルは貴重です。ライセンスと推論コストを確認しておきたいところです。
出典 @_akhaliq↗
Research
@GoogleAI
ショウジョウバエ全 166,000 ニューロンの地図、コミュニティ研究でその能力を検証
Google AI は、オスのショウジョウバエの全 166,000 ニューロンを地図化した理由を示すものとして、コミュニティによる大規模な取り組みを紹介しています。この小さなハエの脳がどれほどのことをできるのかを示す内容で、スレッド形式で解説されています。
メモ
昨日の配線図公開の続報です。地図を作って終わりではなく、それを使って何が分かるかをコミュニティ全体で検証する段階に入っています。データ公開型の研究プロジェクトがどう波及するかの一例として追っておきたいところです。
出典 @GoogleAI↗
Perspective
@natolambert
Nathan Lambert、「AIがAI研究を加速しても急激なRSIには至らない」という別視点を提示
AI 研究者の Nathan Lambert 氏は、現在の議論に対する別の見方を提示しています。AI モデルが AI 研究のプロセスを加速するという前提は置きつつ、それが急速な再帰的自己改善(RSI)や短期的なリスクの爆発的増大にはつながらない、という立場です。
メモ
「加速はする、でも爆発はしない」という中間的な整理です。研究者自身が前提を切り分けて書いているので、極端な楽観・悲観のどちらとも距離を取りたいときの参照点になります。
出典 @natolambert↗
Community
@claudeai
Fable 5.1 Build Days、9月11日〜25日に世界各都市でビルダソンを開催
Claude コミュニティが主催する Fable 5.1 Build Days が今週から始まります。9月11日から25日にかけて世界各地の都市でビルダソンが開かれ、課題やアイデアを持ち込んでも、手ぶらで参加して何ができるか見るだけでもよいとしています。参加登録は Luma 上で受け付けています。
メモ
新モデルを触るきっかけとしては、こうした短期集中のイベントが一番手っ取り早いです。近くの都市で開催があるか Luma のページを確認しておくとよさそうです。
出典 @claudeai↗