Product
@GoogleDeepMind
Gemini 3.8 Live と 3.8 Live Extended Thinking、会話しながら裏でタスクを処理する音声モデル
Google DeepMind が、Gemini 3.8 Live と 3.8 Live Extended Thinking を発表しました。同社が「最良の会話型AI」と位置づけるモデルで、話しながら考え、ユーザーの流れを止めずにバックグラウンドでタスクを処理するとしています。Google AI のアカウントも同時に、これを最も高度な Gemini Audio モデルとして紹介しています。
メモ
音声対話モデルに「Extended Thinking」の派生を分けて出してきたのが注目点です。会話の応答性と、裏で走る推論やタスク実行をどう両立させるかは、音声エージェントを組む際の設計課題そのものなので、2つのモデルの使い分け基準を追いたいところです。
出典 @GoogleDeepMind↗
Product
@claudeai
Salesforce in Claude がベータ公開、37種の営業スキルを同梱
Anthropic が Salesforce in Claude をベータで提供開始しました。取引先・商談・パイプラインのデータを Claude に持ち込み、37種類の事前定義された営業向けスキルが使えます。会話の中から、商談前の準備、案件レビュー、パイプラインのダッシュボード作成、予測の送信などができるとしています。
メモ
外部 SaaS との連携を「接続」ではなく「スキル一式」として出している点が参考になります。CRM の操作をタスク単位の Skill に分解して提供する形は、自前で業務ツール連携を作るときの粒度の目安になりそうです。
出典 @claudeai↗
Product
@gdb
ChatGPT work、既存の BI ツールを接続して社内データの操作やダッシュボード構築に対応
OpenAI の Greg Brockman 氏が、ChatGPT work を紹介しました。企業のデータをもとに操作やアクションを実行するためのもので、ダッシュボードの構築も含まれます。PowerBI、Tableau、Clickhouse、Oracle BI、AWS Redshift など、既存のツールをそのまま接続できるとしています。
メモ
Anthropic の Salesforce 連携と同じ日に、OpenAI 側は BI・データ基盤との接続を打ち出しました。どちらも「モデルの賢さ」ではなく「社内データにどう届くか」を競っており、コネクタ層の設計が差別化点になっている流れが見えます。
出典 @gdb↗
AI Agents
@OpenAIDevs
Cognition の Devin、GPT-6 Astra で「動いた」をテストで裏付けてから出荷
OpenAI の開発者向けアカウントが、Cognition の Devin における GPT-6 Astra の活用事例を紹介しました。チームがコードを出荷する前に、Devin が「it works」という報告をテストで裏付ける流れを GPT-6 Astra が支えているとのことです。
メモ
前日の Perplexity の事例に続き、コーディングエージェントの価値を「テストによる検証」に置く紹介が続いています。エージェントに実装を任せるほど、完了報告をどう検証するかが運用の要になるので、この方向の事例は押さえておきたいです。
出典 @OpenAIDevs↗
Industry
@DeepLearningAI
Claude Fable 5.1 が Intelligence Index v4.2 で首位を維持、GPT-6 Astra と同点
DeepLearning.AI が、Artificial Analysis の Intelligence Index v4.2 の結果を伝えました。Claude Fable 5.1 が首位を維持し、更新されたベンチマーク上で OpenAI の新モデルと同点となっています。v4.2 のスコアは 57 で GPT-6 Astra をわずかに上回り、Terminal Bench では 52.6% を記録したとのことです。
メモ
総合指標では両モデルが並んでおり、順位そのものより Terminal Bench のようなタスク別の数字を見るほうが実用的です。コーディングやエージェント用途で選ぶなら、自分のワークロードに近いベンチで比較するのが良さそうです。
出典 @DeepLearningAI↗
Research
@natolambert
「Never Give Up」: GRPO で全滅したグループを再サンプリングし、難問に計算を寄せる
Nathan Lambert 氏が、RL のスケーリングに関する新しい研究を紹介しました。難しい問題により多くの計算を割り当てるという基本的な発想で、GRPO のグループ内の生成がすべて不正解だった場合、確率 P(約 0.9)で追加サンプリングを行い、勾配がゼロでないバッチを探します。「Never Give Up」と名付けられ、実際に効果があったとのことです。同氏の最初のインターンによる成果で、ブログも公開されています。
メモ
GRPO では全員不正解のグループは勾配に寄与しないため、そこを捨てずに掘り直すという単純なアイデアです。実装はシンプルに見えますが、本人も「実際に動かすのは自明ではない」と述べており、RL の学習効率を上げたい人は論文とブログを読む価値があります。
出典 @natolambert↗
Perspective
@emollick
Astra に画家風のピクセルアート騎士ゲームをワンショットで作らせ、AIの「判断」と「創造性」を論じる
Ethan Mollick 氏が、Astra に「Klimt、Rothko、O'Keefe などの画家にインスパイアされた、必殺技つきのピクセルアート騎士のスプライトを作り、ゲームを組み立てる」と一度だけ指示した結果を紹介しました。人間と同じではないにせよ、AI がある種の「判断」や「創造性」を発揮していないとは言えない例だとしています。できたゲームは公開されており、ワンショットらしい粗さはあるものの遊べる出来とのことです。
メモ
抽象的な指示から、画風の解釈、キャラクター設計、ゲームの実装までを一発で通す例です。プロンプトの粒度をどこまで粗くできるかの目安として、また「粗い部分」がどこに残るかを見る素材として面白いです。
出典 @emollick↗
Practice
@HamelHusain
AI 評価の FAQ に 5 問追加、計 48 問に。機密データを含むトレースや巨大トレースの扱いなど
Hamel Husain 氏が、AI evals の FAQ を更新し、5 つの質問を追加して合計 48 の Q&A になったと発表しました。新しく加わったのは「アノテーション前に参照回答やルーブリックは必要か」「トレースに機密データが含まれる場合の評価方法」「非常に大きなトレースをどうレビューするか」などです。
メモ
評価の実務でつまずきやすい点が質問形式で整理されているので、辞書的に引けるのが便利です。特に機密データ入りのトレースと巨大トレースのレビューは、本番運用に入ると必ず当たる問題なので確認しておきたいです。
出典 @HamelHusain↗
Research
@_akhaliq
論文「Vidu S2」: リアルタイムで対話・編集できる空間的な動画生成
AK 氏が論文「Vidu S2: Real-Time Interactive, Editable, and Spatial Video Generation」を紹介しました。リアルタイムに対話でき、編集可能で、空間性を持つ動画生成をうたっています。論文は Hugging Face Papers で公開されています。
メモ
動画生成が「生成して待つ」から「リアルタイムに操作しながら作る」方向へ進んでいることを示す一本です。インタラクティブ性と編集可能性を同時に掲げているので、どの程度の遅延で成立しているのかを論文で確認したいところです。
出典 @_akhaliq↗
Infrastructure
@PyTorch
PyTorch が AWS Trainium 上でコード変更なしにネイティブ動作、PyTorch Conference で AWS が講演
PyTorch の公式アカウントが、PyTorch Conference North America の基調講演者として AWS Annapurna Labs の Colin Brace 氏を紹介しました。講演「Trainium's Journey to Native PyTorch」では、PyTorch がコード変更なしで AWS Trainium 上にネイティブに動作するようになった経緯と、AWS が eager mode を実現した取り組みが語られるとのことです。
メモ
専用チップは「コードを書き換えずに動くか」で採用のハードルが大きく変わります。Trainium で eager mode がそのまま使えるなら、GPU 以外の選択肢を検討する材料になるので、講演内容を追う価値があります。
出典 @PyTorch↗