ChatGPT sites が 500万に到達、あわせて新機能も追加
OpenAI の Greg Brockman 氏が、ChatGPT sites が 500万に達したことを報告しました。同時に新機能の追加も告知しています。投稿本文は短く、詳細は添付先で案内されています。
数字そのものより、ChatGPT 上に作られたものが「サイト」として数えられる規模になっている点に注目しています。何が作れて何が増えたのか、新機能の中身は一次情報を追って確認したいところです。
CONTACT →
Daily AI Briefing
毎日のようにAI関連のニュースが届きますが、その多くは一次情報ではなく、ノイズも少なくありません。研究機関・開発企業・第一線の専門家による発信の中から、本当に押さえておきたい情報だけを厳選してお届けします。
OpenAI の Greg Brockman 氏が、ChatGPT sites が 500万に達したことを報告しました。同時に新機能の追加も告知しています。投稿本文は短く、詳細は添付先で案内されています。
数字そのものより、ChatGPT 上に作られたものが「サイト」として数えられる規模になっている点に注目しています。何が作れて何が増えたのか、新機能の中身は一次情報を追って確認したいところです。
Andrew Ng 氏が The Batch の最新レターで、優れたAIエンジニアは仕様に沿ってコードを書くだけでなく、何を作るかそのものを形づくる、と述べています。投稿ではエンジニアリングの進め方を一段上げる4つのコアスキルが挙げられ、その1つ目が「ビルドループを自分で回す」、つまり素早くプロトタイプを作り、実際のユーザーをもとに反復することです。
コード生成が速くなった今、仕様を受け取って書く部分の価値は下がり、何を作って誰に当てるかを決めて回す部分に重心が移っています。残り3つのスキルはスレッドの続きに書かれているので、レター本文と合わせて読みたい内容です。
Ethan Mollick 氏は、組織の世界と最先端AIの世界を行き来すると驚くことが多いと書いています。組織側はAIの能力の成長を、しばしば大幅に過小評価しています。一方でAI技術の側は、AIが実世界で見せる能力のギザギザさ(得意と不得意のムラ)を、同じくしばしば大幅に過小評価している、という指摘です。
現場でAIを導入する側と作る側、どちらの思い込みも外れているというのが実感に近いです。モデルが解ける問題の範囲は広がり続けるのに、隣の似た問題で突然つまずく、という両面を前提に設計するしかありません。
Hamel Husain 氏は、評価ツールへの関心が高まっていることを歓迎しつつ、改善の余地をいくつか挙げています。1つ目として、現状のワークフローはプラグインを使った体験の記憶を事前にクイズ形式で尋ねる形になっているが、もっと「その場で(in-situ)」フィードバックを与えられる方がよい、と指摘しています。
評価の専門家からの、使ってみた直後の具体的なフィードバックです。「後から思い出して答える」より「使っている最中にその場で印をつける」方がデータの質が上がる、というのは評価設計の基本で、自作ツールにも当てはまります。
Emad Mostaque 氏は、ある提案のうち最も興味深い部分として「データ」を挙げています。データこそ最重要の材料であり、ここは具体的に決められる、という立場です。汎用モデルはサイバー攻撃に関するデータや、標準的な医療の範囲を超える生物学のデータで学習させるべきではない、としています。厳重に管理された専門用の派生モデルであれば問題ない、とも述べています。
モデルの出力側をガードするより、学習データの入口で線を引くという考え方です。汎用モデルと専門モデルを分ける発想は、業務用途で特定領域の知識だけを持たせたい場面の設計にもつながります。
Towards Data Science に Devesh Rajadhyax 氏が寄稿し、AIコーディングエージェントの時代におけるソフトウェアエンジニアの役割と設計思考について考察しています。「AIはコード生成を容易にするが、それによってソフトウェア設計はより重要になる。重要でなくなるのではない」という主張です。
書くコストが下がるほど、どう分けてどう繋ぐかを決める設計の差がそのまま成果物の差になります。エージェントに任せる前に構造を決めておくと手戻りが減る、という日々の実感とも合います。
Towards Data Science の記事で、筆者の emmimalpa 氏は自身のエージェントシステムで直面した課題をもとに、エージェントにより長い履歴を渡すより、意図の連続性(intent continuity)を与える方が効果的だったと報告しています。
コンテキストに履歴を詰め込むほど良いわけではない、という経験則を言語化したものです。「いま何を達成しようとしているか」を毎ターン明示して渡す方が、過去ログを全部渡すより安定する場面は多いと感じます。
Towards Data Science に tahreemrasul1 氏が、RAGパイプラインを構築するためのフレームワークをハンズオン形式で詳しく書いています。最初から重い構成にするのではなく、観測された失敗モードに応じて複雑さを足していく方針で、字句検索からハイブリッド検索、リランキング、エージェント的な情報探索まで段階的に進めます。
RAGは部品を盛るほど良くなるわけではなく、どの失敗を直すために何を足したかが説明できる状態を保つのが大事です。失敗モードを先に観測してから手を打つ順番は、そのまま評価設計の話にもなります。
Towards Data Science が、Eivind Kjos 氏による Claude Code と Codex の比較記事を紹介しています。いまの自分のニーズにどちらが適しているか判断に迷っている人向けに、明快で具体的な比較をまとめた、としています。
両者は更新が速く、比較記事はすぐ古くなります。結論よりも「どの観点で比べたか」を自分の評価軸として拾っておくのが実用的です。
Towards Data Science に Pirmin Lemberger 氏が、Anthropic の representation workspace の背後にある数学を掘り下げた入門記事を寄稿しました。その基礎となる概念を順に解説する内容です。
モデル内部の表現をどう扱うかは、解釈可能性の研究を追う上で避けられないテーマです。原論文に当たる前に、前提となる数学を一通り整理できる記事として手元に置いておきたいところです。
こうした動きを、自社の業務にどう活かせばいいか ―
迷ったときに相談できる窓口があります。