Product
@ClaudeDevs
Claude Code、5時間制限に達しても編集の途中で止まらず「区切りのいい所」まで進めるように
Claude Code は、作業中に5時間の利用上限に達した場合、編集の途中で打ち切るのではなく、区切りのいい停止点を探すようになった。仕上げに使う分として、週間上限から少量の固定枠が割り当てられる。ロールアウト中の対象は、Pro プランは週1回、Max と Team Premium プランは5時間セッション上限に達するたび。仕上げの先も続けたい場合は追加利用で継続できる。
メモ
長いタスクを任せていて上限で中途半端なファイル状態が残る、という地味に困る事象への対処。プランごとの回数差は把握しておきたい。
出典 @ClaudeDevs↗
Product
@ClaudeDevs
Opus 5.5 は Opus 5 より入出力トークンで20%、キャッシュ読み取りで60%安い。/usage からコスト計算機を提供
Opus 5.5 のトークン単価は Opus 5 と比べて入力・出力ともに20%安く、キャッシュ読み取りは60%安い。それが Claude Code の実際のタスクコストにどう効くかを Anthropic 側で試算し、ユーザーが自分の数字で計算できる計算機を /usage から使えるようにした。
メモ
エージェント用途はキャッシュ読み取りの比率が高いので、単価表の20%より実効の下がり幅は大きいはず。自分のワークロードで測れる導線が用意されたのは親切。
出典 @ClaudeDevs↗
AI Agents
@ClaudeDevs
Claude 向けプラグインの提出・審査・利用状況を扱うポータルを公開。MCP 利用は今年110倍に
Claude 向けプラグインを提出し、審査状況を追い、利用状況を確認できる新しいポータルを公開した。プラグインは MCP とスキルをまとめたパッケージで、Claude 向け開発の標準的な形になりつつあるという。Claude 製品全体での MCP 利用は今年110倍に増えた。提出方法は2通りで、リモート MCP サーバーを指す単体コネクタと、MCP サーバーとスキルを GitHub リポジトリに束ねたプラグインバンドル。提出は Claude 内から直接行う。
メモ
「MCP サーバー単体」と「MCP+スキルの束」の2形態が正式な配布単位になった。自作ツールを配る側には、審査と利用状況が見える窓口ができたのが大きい。
出典 @ClaudeDevs↗
AI Agents
@OpenAIDevs
OpenAI、GPT-6 Astra と GPT-Live-1 による Proaction の車両管理エージェント事例を紹介
車両管理を手がける Proaction は、GPT-6 Astra を使って fleet-management エージェントをより速く構築し、同じ作業をより短い computer-use の実行で完了できているという。あわせて GPT-Live-1 では、ドライバーと会話し、修理工場に電話し、車両整備の手配を手伝う音声エージェントを構築しており、必要に応じて人のチームが介入する形をとっている。
メモ
computer-use は「できるか」より「何ステップで終わるか」が実用のボトルネック。実行が短くなったという言い方は、その指標を意識した訴求として読める。
出典 @OpenAIDevs↗
Product
@GoogleAI
Google、Gemini 3.8 Flash TTS / Flash-Lite TTS と、Live Avatar 付きの Gemini 3.8 Live を発表
Google AI の今週のアップデートとして、音声生成モデル Gemini 3.8 Flash TTS と Gemini 3.8 Flash-Lite TTS が公開された。同社の中でも特に表現力の高い音声生成モデルだとしている。あわせて Gemini 3.8 Live に Live Avatar が加わり、会話 AI にほぼリアルタイムの視覚的な存在感をもたらすとしている。
メモ
TTS に Flash と Flash-Lite の2段階が用意されたので、品質とコストの使い分けが API 側で選べる。音声エージェントを作るなら候補に入れておきたい。
出典 @GoogleAI↗
Research
@StanfordAILab
Stanford、実データゼロの事前学習を検証。ランダム初期化モデルが自己対戦で学習データを自ら生成
Stanford AI Lab が、実データを一切使わない事前学習がどうなるかを問う研究を公開した。ランダムに初期化されたモデルが、自己対戦(self-play)だけで自分の学習データをすべて生成しながら学習できるのかを検証している。Aditya Cowsik、Kfir Dolev、Michael Y. Li らが主導し、Noah Goodman、Yoav Levine らが共著に入っている。
メモ
Web データが枯渇するという議論の対極にある問い。データを外から集めるのではなく、モデル自身が生成する学習ループがどこまで成り立つのか、結果を確かめたい。
出典 @StanfordAILab↗
Open Models
@_akhaliq
Qwen-Image-2.1-viggle-turbo v0.2 が Hugging Face に。6ステップで生成・編集、40ステップ版の約5倍速
Viggle による Qwen-Image-2.1-viggle-turbo の v0.2 が Hugging Face で公開された。テキストからの画像生成と画像編集を6ステップで行い、40ステップの Qwen-Image-2.1 と比べて約5倍速いとしている。
メモ
蒸留版の画像モデルはローカルや自前 GPU での実行コストを直接下げる。編集にも対応しているので、バッチ処理のパイプラインに組み込みやすい。
出典 @_akhaliq↗
Open Models
@natolambert
Nathan Lambert「再帰的自己改善が始まってもオープンウェイトは重要。能力が世界に広がる基盤になる」
Nathan Lambert は、再帰的自己改善(RSI)が動き出せばオープンウェイトモデルは重要でなくなる、という見方が多すぎると指摘する。実際には RSI は二者択一ではなく、オープンソースのスタックこそが多くの能力を世界中へ急速に広める経路になるという。拡散の基盤であるオープンモデルを押さえていなければ、その力学を制御できないと述べている。
メモ
「最先端がクローズドならオープンは無意味」という議論への反論。実務で触れる能力の多くはオープンモデル経由で降りてくる、という視点は開発者側の実感に近い。
出典 @natolambert↗
Perspective
@emollick
Ethan Mollick「入力と出力を混同している。プロンプトを短くしろは良い出力を得るには悪い助言」
Ethan Mollick は、ある主張がインプットとアウトプットを混同していると批判する。目的はタスクを効率よく終えることであり、インプットだけに注目するのは誤りで、トークンコストの最小化だけに集中する企業にも同じリスクがあるという。そのうえで「プロンプトは短く」は、良い AI の出力を得るためには悪い助言だと述べている。
メモ
トークン節約が目的化すると、やり直しの回数が増えて結局高くつく。測るべきは「タスク完了あたりのコスト」だという整理は、エージェント運用でも同じ。
出典 @emollick↗
Perspective
@HamelHusain
Hamel Husain「AI の出力を人が評価しやすくするには、まずプロダクト設計から」
Hamel Husain は「AI の出力を人が評価しやすくするには」という問いに、まずプロダクト設計から始めるべきだと答えている。中間出力を順に確認していくワークフローを設計することで、人がループの中に留まるようにする。人のレビュアーが AI の出力を注意深く確認せずに承認してしまう問題を扱った、Evals FAQ の記事として公開している。
メモ
最終出力だけ見せると、人は「だいたい合ってそう」で通してしまう。中間出力を見せる UI は評価の質を上げる仕掛けであり、評価基盤の設計とプロダクト設計は切り離せない。
出典 @HamelHusain↗
Perspective
@TDataScience
コーディングエージェントの限界。「コードもテストも同じ曖昧な仕様の同じ読みから生まれる」
Towards Data Science の新しい連載で、Gal Arav がコーディングエージェントの根本的な制約を扱っている。問題は、コードとテストの両方が同じ曖昧な文章の同じ解釈から生成されることで、その結果テストが実装に異を唱えられなくなる、という指摘だ。
メモ
エージェントに「テストも書いて」と頼むと通るテストは書けるが、仕様の読み違いは検出できない。テストの独立性をどう確保するかは、実装とは別のセッションや別の入力で書かせるなど設計で対処する必要がある。
出典 @TDataScience↗