Product
@OpenAIDevs
OpenAI、GPT-6 Astra を発表 ― コンピュータ操作とソフトウェア開発で過去最高性能
OpenAI が新モデル GPT-6 Astra を発表した。コンピュータ操作(computer use)、ソフトウェアエンジニアリング、視覚理解において同社の過去最高のモデルだとしている。発表では、実際に活用しているビルダーたちの声も紹介されている。
メモ
「computer use」を筆頭に挙げているのが特徴的。エージェントに画面を直接操作させる方向へ、フロンティアモデルの競争軸が明確に移ってきた。
出典 @OpenAIDevs↗
Dev Tools
@ClaudeDevs
Claude Code に「Function Hooks」構想 ― 拡張・カスタマイズの新しい仕組みを検討中
Anthropic の開発者チームが、Claude Code を拡張・カスタマイズする新しい仕組み「Function Hooks」を検討していると発表した。何ができるようになるかを示すデモ動画を公開しており、まだ未リリースの段階で、GitHub の issue でフィードバックを募っている。
メモ
出荷前の構想段階で公開してフィードバックを募るスタイル。Claude Code を日常的に使っているなら、issue を覗いて要望を出しておく価値がある。
出典 @ClaudeDevs↗
Research
@GoogleAI
Google、天気予報AI「WeatherNext 3」を発表 ― 前世代比で最大5倍シャープな予測
Google DeepMind と Google Research が、最新の全球気象予測AIモデル WeatherNext 3 を発表した。予測能力は WeatherNext 2 と比べ最大5倍シャープになり、高い空間解像度で予報を生成する。実世界のリアルタイム観測データから直接学習することで、より局所的で高精度な予測を高速に出せるという。
メモ
物理シミュレーション主体だった気象予報を学習ベースのモデルが置き換えつつある代表例。「観測データから直接学習」という方式の進化は他の科学分野への応用も示唆する。
出典 @GoogleAI↗
Benchmark
@gdb
「ARC-AGI-3 は飽和した」― OpenAI Greg Brockman 氏が短く報告
OpenAI 共同創業者の Greg Brockman 氏が、推論能力を測るベンチマーク ARC-AGI-3 が「飽和した(saturated)」と投稿した。GPT-6 Astra の発表と同日のポストで、詳細な数値には触れていない。
メモ
ARC-AGI は「解けないこと」に意味があったベンチマーク。飽和が事実なら、次に何で汎化能力を測るのかという問題が改めて浮上する。
出典 @gdb↗
Perspective
@emollick
GPT-6 に数万通のメールと文書を読ませ、個人ナレッジベースを構築 ― Mollick 教授の実験
Wharton の Ethan Mollick 教授が、GPT-6 に自身の数万通のメール、執筆物、カレンダーの予定などを読み込ませ、研究・人脈・アイデア・タスクを整理した個人ナレッジベースを組み立てさせる実験を紹介した。実用的なナレッジワークの例として挙げている。
メモ
「自分の全データを読ませて構造化させる」はエージェント時代の定番ユースケースになりそう。長大なコンテキストの処理を実務でどこまで任せられるかの目安になる。
出典 @emollick↗
Perspective
@swyx
swyx 氏「AI Engineering は新しい時代に入った。もう後戻りはない」
AI Engineering コミュニティを牽引する swyx 氏が、Astra を使い込んだうえで「AI エンジニアリングの新しい時代に入った。二度と後戻りすることはない」と投稿した。Astra で行った取り組みのレポートを今後順次公開していくとしている。
メモ
新モデルの真価はベンチマークより実践者の使い込みレポートに表れる。続報のレポートは追う価値がありそう。
出典 @swyx↗
Research
@DeepLearningAI
AIエージェントに「ガベージコレクション」を ― コンテキストを選別する Self-GC
Xiaohongshu の研究者らが、プランナーLLM を使ってコンテキスト内のどのトークンを保持・折りたたみ・削除するかを判断する手法「Self-GC」を発表した。テストでは、必要な詳細情報の保持率が標準的な手法の 54.55% に対して 84.85% だった。
メモ
長時間動くエージェントのコンテキスト管理は実装上の急所。「何を捨てるか」を LLM 自身に判断させるアプローチは、自前のエージェント設計にも応用しやすい。
出典 @DeepLearningAI↗
Benchmark
@StanfordAILab
公開1週間の Terminal-Bench-Science、最先端モデルの能力実証に早くも採用
Stanford AI Lab によると、世界で最も高性能なモデルたちが、その能力を示すために Terminal-Bench-Science を使い始めている。ベンチマークの公開からわずか1週間でのことで、開発した Steven Dillmann 氏らのチームの影響力を称えている。
メモ
ターミナル操作×科学タスクという評価軸が、公開直後からフロンティアモデルの標準評価に食い込んだ点が興味深い。既存ベンチマークの飽和と表裏一体の動き。
出典 @StanfordAILab↗
Education
@StanfordAILab
Stanford にAIエージェント工学の講義が新設 ― Diyi Yang 氏らが今秋初開講
Stanford AI Lab が、AIエージェントのエンジニアリングを学ぶ講義を今秋に初めて開講すると告知した。Diyi Yang 氏、Michael Ryan 氏、John Yang 氏ら、この分野を熟知した研究者が教壇に立つ。
メモ
エージェント開発が大学の正規科目になる段階に来た。シラバスや教材が公開されれば、体系的に学び直す教材として使えるはず。
出典 @StanfordAILab↗