Open Models
@natolambert
Xiaomi の MiMo-V2.6 が Artificial Analysis でオープンモデル首位に
Xiaomi が MiMo-V2.6-Pro(総パラメータ1.02T、アクティブ42B)と MiMo-V2.6-Flash(310B、アクティブ15B)を公開した。Artificial Analysis のランキングでオープンモデルのトップに立っている。RL の学習過程を見られるダッシュボードとテクニカルレポートも合わせて出ており、Nathan Lambert は「採用がどう広がるか気になる」としている。
メモ
スコアだけでなく RL ダッシュボードまで公開する姿勢が珍しい。MoE の Flash 版はアクティブ15Bなので、自前ホストの候補として見ておきたい。
出典 @natolambert↗
AI Agents
@DeepLearningAI
Meta の Muse エージェントは「モデルは騙される前提」で OS レベルに防御を置く
プロンプトインジェクション対策をモデル自身の学習だけに頼るべきではない、という設計思想の紹介。Meta の Muse エージェントは、モデルが騙されることを前提に、セキュリティを OS 層で組み立てている。モデルは本物の認証情報を一切扱わず、ツールは隔離された Linux コンテナ内で実行される。
メモ
「モデルに気をつけさせる」より「漏れても被害が出ない構造にする」方が確実。自作エージェントでも、シークレットの分離とコンテナ実行はそのまま真似できる。
出典 @DeepLearningAI↗
Engineering
@PyTorch
RL ポストトレーニングは「速いカーネル」だけでは動かない
PyTorch が、RL によるポストトレーニングのパイプラインを end-to-end で運用する難しさを解説している。個々のカーネルを効率よく回すだけでは足りず、分散学習・ロールアウト生成・重みの継続的な同期をシステム全体で協調させる必要があるという。
メモ
RL 後学習はいまや LLM 開発の必須工程。学習側と推論(ロールアウト)側で重みをどう同期するかが、実装の一番面倒なところ。
出典 @PyTorch↗
Perspective
@emollick
OpenAI が数学者と協力し、新しい証明を「混乱を招かない形」で公開する
Ethan Mollick は、AI が世の中を変えるスピードが多くの人の予想より遅くなる理由の一例として、OpenAI が数学者と協力して新しい証明を混乱の少ない方法で公開しようとしている件を挙げた。同じことが、法曹界や医師会などほかの専門職でも、より強い形で起きるだろうと見ている。
メモ
技術的に可能かどうかより、既存のコミュニティが受け入れる手順の方が普及速度を決める、という視点。開発者側が作るものにも「出し方」の設計が求められる。
出典 @emollick↗
Open Models
@natolambert
米議会スタッフ向けに「オープンモデルの性能・採用・対中競争」の資料を公開
Nathan Lambert が、米議会スタッフから求められたオープンモデルに関するブリーフィングを公開した。性能・採用状況・中国との競争について、最新データと今後の予測をまとめたもの。本人は「幅広い読者向けにオープンモデルの内容を発信できるのは嬉しい」としている。
メモ
オープンモデルの現状を一枚で追える資料。モデル選定の背景を人に説明するとき、データの出典として使いやすい。
出典 @natolambert↗
Open Source
@PyTorch
TinyTorch:PyTorch の API で ML フレームワークを一から作る無料教材
TinyTorch は、テンソルから Transformer まで、動作する機械学習フレームワークをゼロから組み上げる無料・オープンソースのカリキュラム。PyTorch 自身の API を、純粋な Python で実装していく構成になっている。GPU は不要とされている。
メモ
「成熟したシステムにはいつか教育版が必要になる」という言葉どおりの教材。autograd や attention の中身を手で書きたい人向け。
出典 @PyTorch↗
Product
@TDataScience
TypeSafe の System One モデル「Jev」は従来の LLM と何が違うか
話題になっている TypeSafe の System One モデル Jev について、Mariya Mansurova が従来の LLM との違いを解説している。インテント分類のワークフローで OpenAI のモデルと比較した内容も含む。
メモ
分類タスクは LLM を使うと過剰なことが多い。専用モデルがどこまで使えるかの実測比較は、ルーティング層の設計判断に効く。
出典 @TDataScience↗
AI Agents
@TDataScience
評価ガードレールは「正常」なのにマルチエージェントが壊れるとき
本番環境でマルチエージェントシステムを運用していると、評価上のガードレールは問題なしと言っているのにシステムが失敗する場面に必ず出会う、という記事。Benjamin Nweke が、そうした状況で何をすべきかを解説している。
メモ
eval が緑でも本番で崩れるのはエージェント系の典型。評価指標と実際の失敗のずれをどう埋めるかは、運用フェーズに入った人ほど刺さる。
出典 @TDataScience↗
Engineering
@TDataScience
マルチエージェントの運用コストを、適応型モデルルーティングで抑える
マルチエージェントシステムをデプロイした後、維持コストの高さに驚いた人向けのガイド。Partha Sarkar が、タスクに応じてモデルを切り替える適応型ルーティングによるコスト最適化の実践的な知見をまとめている。
メモ
全ステップを最上位モデルで回す必要はない。どの分岐を小さいモデルに落とせるかを見極めるのが、エージェント運用の次の課題になる。
出典 @TDataScience↗
Tools
@TDataScience
Codex / Claude Code 向けの「週次データ可視化」エージェントスキル
Yu Dong が、Codex と Claude Code で使えるエージェントスキルを紹介している。データセットの確認から、公開できる品質のストーリーテリングチャートを作るところまで、週1回の可視化練習を自動化するもの。
メモ
コーディングエージェントの「スキル」を、開発以外の定型ワークフローに使う例。手順書をスキル化しておく発想は、他の反復作業にも転用できる。
出典 @TDataScience↗