Frontier Models
@claudeai
Anthropic、Claude Fable 5.1 と Claude Mythos 5.1 を発表
Anthropic が Claude Fable 5.1 と Claude Mythos 5.1 を発表した。コーディングとナレッジワークにおいて世界で最も先進的なモデルだとしている。あわせて Fable 5.1 は複雑で長時間にわたるタスクに強く、その研究能力は AI モデルが科学の進歩に貢献していく姿の先駆けだとも述べている。
メモ
Claude 5 世代の最初のアップデート。長時間タスクへの耐性を前面に出しており、エージェント用途を主戦場に据えていることがはっきり読み取れる。
出典 @claudeai↗
Dev Tools
@ClaudeDevs
Fable 5.1 が Claude Code と Claude Platform で利用可能に — 価格は据え置き、キャッシュ読み取りは75%安く
Fable 5.1 が Claude Code と Claude Platform で提供開始された。価格は Fable 5 と同じで、API のキャッシュ読み取りは75%安くなる。長いタスクでユーザーの入力を求めるまでにより先まで進められるようになり、行き詰まったときにそれを伝えるのも上手くなったほか、文章のスタイルもより自然になったという。
メモ
キャッシュ読み取り75%引きは、長いコンテキストを繰り返し読むエージェントの運用コストに直接効く。「詰まったら正直に言う」方向の改善も、放置運用のしやすさに関わる実務的なポイント。
出典 @ClaudeDevs↗
Benchmarks
@ClaudeDevs
Fable 5.1、Terminal-Bench 4.0 で55.8% — Fable 5 と Opus 5 を上回る
Anthropic の開発者アカウントによると、Fable 5.1 はエージェンティックコーディングとコンピュータ操作の社内評価全般で Fable 5 と Opus 5 の両方を上回った。Claude Code 上での Terminal-Bench 4.0 のスコアは 55.8% で、同条件の Fable 5 は 42%、Opus 5 は 52.3% だという。
メモ
同一セットアップでの比較として Fable 5 から13ポイント超の伸びはかなり大きい。ターミナル操作系のベンチはエージェントの実務性能と相関しやすいので、体感がどう変わるか試したい。
出典 @ClaudeDevs↗
Multimodal
@GoogleDeepMind
Gemini に「エージェント的な動画理解」— 精度を上げつつトークンは最大88%削減
Google DeepMind が、最新の Gemini モデルにエージェント的な動画理解(agentic video understanding)を導入すると発表した。動画をより高い精度で分析しながら、使用トークンを最大88%削減できるという。
メモ
動画入力はトークン消費が桁違いに大きく、コストが実用化のボトルネックだった。88%削減が本当なら、長尺動画の解析やモニタリング用途が一気に現実的になる。
出典 @GoogleDeepMind↗
Speech
@AIatMeta
Meta Superintelligence Labs 初のリアルタイム音声認識モデル「Muse Voice Transcribe」
Meta が、Meta Superintelligence Labs 初のリアルタイム音声知覚モデル Muse Voice Transcribe を発表した。リアルタイムのストリーミング音声認識(ASR)に加え、20人以上の話者分離(ダイアライゼーション)とエンドポインティングに対応。多言語対応で、言語が混ざるコードスイッチングもシームレスに扱えるという。
メモ
20人超の話者分離をストリーミングでこなせるなら、会議の文字起こしパイプラインの設計がだいぶ変わる。Superintelligence Labs 名義の最初のプロダクトが音声というのも興味深い。
出典 @AIatMeta↗
Open Models
@DeepLearningAI
GLM-5.3、脆弱性ベンチマーク CyberGym で84.5% — トップの独自モデルを上回る
DeepLearning.AI によると、Z.ai の GLM-5.3 が脆弱性ベンチマーク CyberGym で 84.5% を記録し、トップクラスのプロプライエタリモデルを上回った。前身の GLM-5.2 から大幅な向上で、Z.ai のエンジニアはこれをファインチューニングと最適化のみで達成したとしている。
メモ
昨日の Artificial Analysis 指数に続き、GLM-5.3 が個別ベンチでも独自モデル超えを示した形。ベースを変えずにポストトレーニングだけでここまで伸びるという点が、オープンウェイト活用の追い風になる。
出典 @DeepLearningAI↗
Industry
@DeepLearningAI
推論速度の競争が加速 — GPT 5.6 Sol は750トークン/秒、Gemini 3.7 Flash は平均330トークン/秒
DeepLearning.AI が、主要AI企業が推論速度を「対価を払う価値のあるアーキテクチャ要件」と捉えるようになっていると指摘。OpenAI と Cerebras は GPT 5.6 Sol が毎秒750トークンで動作するデモを行い、Google は平均毎秒330トークンの Gemini 3.7 Flash をリリース、Nvidia も Nemotron 3.5 Lightning を投入したという。
メモ
エージェントは1タスクで何十回もモデルを呼ぶため、応答速度がそのまま体験とスループットを決める。賢さの競争と並行して、速度が独立した競争軸として確立しつつある。
出典 @DeepLearningAI↗
Perspective
@emollick
「個人利用では OpenAI と Anthropic の独走が続く」— Ethan Mollick の市況観
Ethan Mollick が、この1年の大きな変化として、企業内での利用を含む一般的な個人利用では OpenAI と Anthropic が独走状態になったと指摘。両者は首位を交互に入れ替えており、どちらを選んでも追随し続けると分かっている状態で、他のプレイヤーが割って入ってから10か月経つという。Kimi や Grok などから価値を引き出せないわけではないが、セットアップの最適化やプロダクト乗り換えをいとわない知識が必要で、Anthropic と OpenAI を選ぶのは簡単な選択だとも述べている。
メモ
「どちらを選んでもキャッチアップしてくる」という安心感がデファクト2強を固めているという観察。ツール選定を頻繁に見直せないチームほど、この構図の影響は大きい。
出典 @emollick↗
AI Agents
@emollick
「エージェントの実力と世間の認識のギャップは指数関数的に広がっている」
Ethan Mollick が、エージェントについて AI の能力と世間の認識の間にまた大きなギャップが生じていると指摘。能力が指数関数的に伸びるため、このギャップは時間とともに広がっているという。エージェントは急に、長時間の自己組織的な仕事を本当にこなせるようになっており、それには AI への新しいアプローチが必要だと述べている。
メモ
「長時間の自己組織的な仕事」を前提にすると、プロンプトの書き方よりもタスクの切り出し方・検証の仕組みの設計が主戦場になる。日々使っている側の体感とも一致する指摘。
出典 @emollick↗
Research
@_akhaliq
論文「Does On-Policy Distillation Really Distill?」— ノイズの多い教師から自己改善へ
AK が Hugging Face Papers に公開された論文「Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement」を紹介した。オンポリシー蒸留が本当に「蒸留」として機能しているのかを問い直す内容だ。
メモ
オンポリシー蒸留は小型モデルを実用水準に引き上げる定番手法になりつつあるだけに、その効き方の実態を問う研究は押さえておきたい。タイトルの「ノイズの多い教師から自己改善へ」という展開も気になる。
出典 @_akhaliq↗
RAG
@TDataScience
高度なRAGテクニックの前に、検索サブシステム単体の評価を — TDS の解説記事
Towards Data Science が Tahreem Rasul 氏による RAG の解説記事を紹介。高度なテクニックは複雑な情報探索タスクの性能を実質的に改善しうる一方で、土台となる検索サブシステムが独立に評価される前に導入されてしまうことが多い、と指摘する内容だ。
メモ
リランキングやクエリ拡張を足す前に、まず素の検索がどれだけ当たっているかを測れという話。RAG の改善が行き詰まったときに立ち返るべき基本で、評価の順序を間違えると原因の切り分けができなくなる。
出典 @TDataScience↗