AI Agents
@ClaudeDevs
Claude Managed Agentsに予算上限・アドバイザーなど今週4つのアップデート
Claudeの開発者向けアカウントが、Claude Managed Agentsへの今週の4アップデートを発表した。セッションに予算を設定できるようになり、上限に達したセッションはbudget_reachedイベントとともに一時停止、予算を引き上げれば再開できる。続くポストでは、接続したリポジトリの.claude/skills/からスキルを自動で読み込む機能や、セッション中により強いモデルに意見を求められる「advisor」をロスターに1行追加するだけで付けられる機能も紹介している。
メモ
エージェントを常時運用するときの最大の不安はコストの暴走。予算のガードレールと「強いモデルに相談する」パターンが公式機能として入ったのは、実運用設計にそのまま効いてくる。
出典 @ClaudeDevs↗
Industry
@gdb
GPT-4の学習完了から、今日でちょうど4年
OpenAIのGreg Brockman氏が「GPT-4 finished training four years ago today」と投稿。GPT-4のトレーニングが完了してから4年の節目になる。
メモ
4年前のフロンティアモデルが今どの位置にいるかを考えると、進化の速度を測る基準点として面白い。当時と今のエージェント能力の差は特に大きい。
出典 @gdb↗
Product
@gdb
Brockman氏、「luna」の価格性能比を強調
同じくBrockman氏が「lunaは特別なモデルで、価格性能比が信じられないほど良い」と短く投稿した。モデルの詳細やスペックには触れていない。
メモ
一言だけの投稿だが、OpenAI幹部が名指しで価格性能を推すモデルはAPI利用時のコスト設計に直結する。位置づけの続報を追いたい。
出典 @gdb↗
Perspective
@demishassabis
AlphaGoの「37手目」から10年 — 検証可能な領域での科学的ブレークスルーへ
DeepMindのDemis Hassabis氏が、AlphaGoの有名な「move 37」について対談したと投稿。10年を経て、数学や科学といった検証可能なドメインでのブレークスルーにとってあの一手が持つ意義を語ったという。
メモ
「検証可能な領域」は最近の推論モデルやRLの進展を語る上でのキーワード。move 37を起点にDeepMindが何を狙っているのか、対談本編は要チェック。
出典 @demishassabis↗
Industry
@emollick
「OpenAI AIハック」の解説動画、Mollick氏が強く推奨
WhartonのEthan Mollick氏が、OpenAIのAIハックに関する動画を「普段テックに関心がない人でも見るべき」と推奨。特に18分あたりからの、エージェント同士が互いに会話する場面は目を見張る内容だという。
メモ
エージェント間の通信が実際のインシデントでどう見えるのかを一次映像で確認できる機会は少ない。防御側の視点でも見ておきたい。
出典 @emollick↗
Perspective
@natolambert
「人間だと名乗るAIサポートボット」にAI研究者が怒り
Ai2のNathan Lambert氏が、Xfinityのカスタマーサポートボットについて、明らかにAIなのに「人間だ」と答えるよう指示されていると批判。続くポストでは「顧客をガスライティングするとはすごい選択だ。多くの人がAIに怒りを向ける理由がよく分かった」と述べ、声をランダムに変えて気づかれにくくしているとも指摘した。
メモ
ボットがAIであることの開示はUX以前の信頼の問題。自社プロダクトにエージェントを組み込むとき、最初に守るべき一線を再確認させられる。
出典 @natolambert↗
AI Agents
@TDataScience
Claude Codeエージェント100体超を並列オーケストレーションする
Towards Data Scienceが、Eivind Kjos氏の解説記事を紹介。コーディングエージェントの本当の強みは大規模な並列実行にあるとして、100体を超えるClaude Codeエージェントを効率よくオーケストレーションする方法を解説している。
メモ
1体との対話から並列フリートの管理へと、エージェント運用の重心が移りつつある。この規模のノウハウはまだ体系化されておらず、実践記事は貴重。
出典 @TDataScience↗
Open Models
@TDataScience
Apple SiliconでローカルLLMを動かすコストを実測分析
Justin Stewart氏が、Apple Silicon上でローカルLLMを動かすコストを詳細に分析。5つのモデルを対象に、持続的な生成と細かな電力料金まで含めて検証したという。
メモ
「ローカルなら無料」ではなく、電力まで含めた実測ベースの数字はAPI課金との比較材料になる。手元のMacでどこまで賄うかの判断に使える。
出典 @TDataScience↗
Product
@TDataScience
MCPは何を解決するのか — 「統合の書き直し」問題から理解する
「モデルが変われば統合を書き直し、新しいツールが出ればまた一から統合を書く必要があった」。Towards Data Scienceが、MCPが解決しようとしている課題と、実際にどう機能するのかを解説する記事を紹介した。
メモ
MCP対応を前提にした設計が当たり前になりつつある今、「そもそも何の問題を解くプロトコルなのか」を押さえ直すのに良い題材。
出典 @TDataScience↗