Industry
@DeepLearningAI
Andrew Ng、AI開発の「減速」を求める声に反論。Hugging Face侵害の実態にも言及
今週のニュースレターで Andrew Ng が、AI企業や最近退職した研究者たちによる「開発を減速すべき」という主張に応えている。直近では OpenAI のエージェント1,200体の群れが Hugging Face のシステムを侵害したと報じられたが、Ng は実際の侵害の原因はそこではなく別の不備にあったと指摘している。
メモ
「エージェントの暴走」として拡散した事案を、セキュリティの基本的な不備の問題として捉え直す視点。減速論の根拠として引用される事例は、原因を切り分けて読む必要がある。
出典 @DeepLearningAI↗
Perspective
@natolambert
推論時計算のスケールは見誤っていた。だが「知能爆発が近い」とは言えない
Nathan Lambert が、最近の出来事とAIの軌道について「穏健派の見方」を示した。近い将来に推論時計算(inference-time compute)がどれほどスケールするかは自分が過小評価していたと認める一方、それは再帰的自己改善(RSI)とは別物であり、知能爆発が近いと確信できるだけの材料はまだ見ていないという。
メモ
推論時計算の増加とRSIを混同しないという線引きは、今後の能力向上を見積もるときの実用的な基準になる。オープンモデル研究の当事者からの整理として押さえておきたい。
出典 @natolambert↗
Research
@natolambert
CS研究者にとって最重要の課題は「LLMが支援する査読」ではないか
Nathan Lambert は、コンピュータサイエンスの研究者にとって最も重要な研究課題のひとつは LLM に監督された査読(peer review)だと述べた。これを解決しなければ既存の学術機関は立ち行かなくなるとし、新しい機関をゼロから作るよりも実現しやすいはずだという。
メモ
投稿数の急増で査読が回らない問題は、AI研究の会議で顕在化している。LLMを査読の全面代替ではなく監督役に据える設計は、コードレビューの自動化とも通じる論点。
出典 @natolambert↗
Evals
@HamelHusain
LLM Judge も「分類器」。人手ラベルで検証し、過学習させない
「Jev を Evals に使えるか」という質問に Hamel Husain が「使える」と回答。ただし LLM Judge も分類器のひとつであることを忘れず、必ず人手ラベルに対して分類器を検証し、過学習させないよう注意を促した。あわせて、1〜5段階のリッカート尺度ではなく二値(合格/不合格)評価を勧める理由を解説した記事を紹介している。
メモ
LLMに採点させると「評価している気」になりやすいが、Judge自体の精度を人手ラベルで測らなければ数字の意味がない。二値評価の推奨も含め、評価設計の基本として繰り返し確認したい。
出典 @HamelHusain↗
Evals
@HamelHusain
「トレース」とは何か。最初のクエリから最終応答までの完全な記録
Hamel Husain の Evals FAQ から。「トレースとは何か」という問いに対し、ユーザーセッションの最初のクエリから最終応答までの完全な記録であり、ツール呼び出しや中間ステップも含まれる、と定義している。
メモ
エージェントのデバッグや評価は、まずトレースを残すところから始まる。ツール呼び出しと中間ステップまで含めるという定義は、ログ設計の最低要件として使える。
出典 @HamelHusain↗
Product
@emollick
Fable に一言で「ズームアウトするゲームを作って」と頼んだ結果
Ethan Mollick が Fable に「ズームアウトをテーマにした、グラフィックの美しいゲームを作って。ズームアウトするたびに驚きの展開を」とだけ指示し、それ以外の指示は与えなかった。結果は引き込まれる奇妙なもので、出来はムラがあるとしつつ、ネタバレなしで試す価値があるとしている。続く投稿では同じ指示を Astra にも与え、結果は洗練されているが、Fable に比べて「シミュレーションの結果に関心を示す」ような振る舞いが少なかったと述べた。
メモ
指示を最小限にしてモデルの「趣味」を見る実験。同じプロンプトで複数モデルの解釈の差を見る方法は、モデル選定の感触をつかむうえで手軽に真似できる。
出典 @emollick↗
Tools
@TDataScience
2026年のデータサイエンスに加えたい Claude スキル4選
Towards Data Science より。AIは日々のデータサイエンスの作業に組み込まれつつあるが、効果的に使うにはプロンプトを書く以上のことが必要だとして、Haden Pelletier が2026年にツールキットへ加える価値のある Claude スキルを4つ紹介している。
メモ
スキルはプロンプトを再利用可能な手順として固定する仕組み。データ分析の定型作業をどこまでスキル化できるかの事例として参考になる。
出典 @TDataScience↗
Engineering
@TDataScience
肥大化した Python パイプラインは、独立デプロイできる複数の MCP サービスに分ける
Towards Data Science より。単一の Python パイプラインが扱いにくく、遅く、入り組んできたら、独立してデプロイできる複数の MCP サービスに切り替えることを Priyansh Bhardwaj が提案している。
メモ
MCP をエージェント接続の口としてだけでなく、サービス分割の単位として使う発想。マイクロサービス化の議論がエージェント時代にどう形を変えるかの一例。
出典 @TDataScience↗
Tools
@TDataScience
エージェントコーディングの「静かな失敗」を捕まえるツール
Towards Data Science より。エージェントによるコーディングのパイプラインで、エラーを出さずに起きる失敗をどう捕まえるか。Reya Vir が、作られたアプリが自分の意図に沿っているかを開発者が検証するために自作したツールを紹介している。
メモ
テストが通っても意図とずれている、というのがエージェント開発の典型的な失敗。「意図との整合」を検証対象にする発想は、レビュー工程の設計に応用できる。
出典 @TDataScience↗
Research
@TDataScience
ニューラルネットを「関数空間」ではなく「パラメータ空間」で理解する
Towards Data Science より。ニューラルネットの入門の多くは、ネットワークが何を計算するか、活性化関数がどう直線を曲線に変えるかといった関数空間の話にとどまる。この記事はパラメータ空間に踏みとどまり、「良い解の集合」が実際にどんな形をしていて、その幾何が何を要求するかを扱う。
メモ
損失地形や解の形状は、学習率やファインチューニングの挙動を直感的に理解する土台になる。入門の次の一歩として読む価値がある切り口。
出典 @TDataScience↗
Perspective
@natolambert
「AIはいつXの仕事を奪うか」という問いの立て方がずれている
Nathan Lambert は、AI予測の議論の大きな問題として、人々が「AIはいつXという仕事を置き換えるか」と問うことを挙げた。実際には、AIはその仕事に必要な多数のサブスキルを少しずつ置き換えていくが、すべてを置き換えることはめったにないという。
メモ
職種単位ではなくサブスキル単位で見るという整理は、自分の業務のどこを自動化するかを考えるときにもそのまま使える。
出典 @natolambert↗