Industry
@demishassabis
Demis Hassabis 氏、Dario Amodei 氏のエッセイに賛同を表明
Google DeepMind の Demis Hassabis 氏が、Anthropic の Dario Amodei 氏が発表したエッセイについて「正しい道筋を示している」と述べました。細部は詰める必要があるものの、この重要な局面に向き合う方向性は正しいとしています。あわせて、DeepMind が最近公開した「フロンティアAI向けの業界横断の標準化団体」の提案にも言及しました。
メモ
フロンティアラボのトップ同士が公開の場で方向性を揃えるのは珍しい動きです。標準化団体が実現すれば、モデルの評価基準や公開手順が業界で共通化され、開発者が扱うAPIやモデルカードの形式にも影響しそうです。
出典 @demishassabis↗
Perspective
@EMostaque
Emad Mostaque 氏は「pacing the frontier」提案に論理的な難点があると指摘
Stability AI 創業者の Emad Mostaque 氏が、Dario Amodei 氏の「pacing the frontier」提案について、善意によるものだが論理的な欠陥があると述べました。「知能そのものを犯罪視する」暗黙の前提にも問題があるとしています。OpenAI の取締役会ですら十分に強力な評価者ではなかったことを例に挙げ、外部からの監督よりもAIの内部構造(internals)に焦点を当てるべきだと主張しています。
メモ
上の Hassabis 氏の賛同とは対照的な見方です。「外部からのガバナンス」か「モデル内部の解釈可能性」か、という論点は、開発者にとっては interpretability 研究の優先度がどう変わるかに直結します。
出典 @EMostaque↗
Perspective
@emollick
Ethan Mollick 氏「GPT-6 Astra と Fable 5.1 は、すでに経済の広い領域を変えるのに十分」
ウォートン校の Ethan Mollick 氏が、GPT-6 Astra と Fable 5.1 はすでに経済の大きな部分に変革的な影響を与えるのに十分な能力を持っていると強調しました。適切に指示し、仕組みを整えて使えば、人間の数週間分の仕事を安定してこなせるとしています。ただし、その影響は一斉には訪れず、分野によって偏りがあるとも述べています。
メモ
「properly guided & harnessed」という条件付きなのがポイントです。モデルの能力は足りていて、ボトルネックは指示の設計と周辺の仕組み(ハーネス)側にある、という見立ては、いま何を作るべきかの判断材料になります。
出典 @emollick↗
Open Models
@natolambert
Nathan Lambert 氏「オープンソースの全面禁止は、よりディストピア的な結果を招く」
Ai2 の Nathan Lambert 氏が、オープンソースAIの全面禁止はより悪い結果をもたらすと述べました。一定の能力を持つオープンウェイトモデルの公開を「一時停止」すべき場面はあり得るものの、その判断には非常に慎重な専門知識が必要だとしています。実際には、漠然とした不安から、オープンモデルが時期尚早に禁止される可能性のほうが高いと懸念しています。
メモ
ローカル実行やファインチューニングをオープンウェイトに依存している開発者には無視できない論点です。規制の議論が「能力の閾値」ではなく「雰囲気」で進むリスクを、当事者が明確に言語化しています。
出典 @natolambert↗
Open Models
@natolambert
オープンモデル・オープンソースAIの必読記事 50本超のリストが公開
Nathan Lambert 氏が、ここ数年で自身が読み、頼りにしてきたオープンモデル・オープンソースAIに関する記事やリソースを50本超まとめたリストを公開しました。
メモ
OLMo など実際にオープンモデルを作ってきた当事者の選書です。オープンウェイトの流れをキャッチアップしたい人にとって、まとまった入口になります。
出典 @natolambert↗
Research
@StanfordAILab
Stanford の新講義「CS 312: Deep Learning Alchemy」、録画と教材をすべて公開へ
Stanford AI Lab が、Tatsunori Hashimoto 氏と Suhas Kotha 氏による講義「CS 312: Deep Learning Alchemy」を紹介しました。講義の録画と教材はすべて公開される予定です。
メモ
「Alchemy(錬金術)」というタイトルが示す通り、深層学習の経験則や勘所を体系的に扱う講義と見られます。一線の研究者による最新の講義が無償で追えるのはありがたい話です。
出典 @StanfordAILab↗
Dev Tools
@HamelHusain
Hamel Husain 氏「Codex のパワーユーザーなら、新しい軽量ツールは YAGNI」
ML エンジニアの Hamel Husain 氏が、Muse や Bot といったツールでできることは Codex でも簡単にできると述べました。「less is more」という形の魅力は理解できるとしつつ、すでに Codex デスクトップでコンピュータ操作、リモートアクセス、スレッド管理、音声操作などを使いこなしているパワーユーザーには不要(YAGNI)だとしています。
メモ
コーディングエージェントのツールが増える中で、「乗り換えるべきか」を判断する一つの基準です。すでに使い込んでいる環境があるなら、新しさより既存ワークフローの深さを優先する、という考え方は堅実です。
出典 @HamelHusain↗
Engineering
@TDataScience
LLM の構造化出力は「正しく見えて壊れている」ことがある
Towards Data Science が、Mostafa Ibrahim 氏による記事を紹介しました。enum や配列のハルシネーションから分布の崩壊(distributional collapse)まで、LLM の構造化出力が表面上は正しく見えながら、深刻で見つけにくいデータエラーを隠してしまう様々なパターンを整理しています。
メモ
JSON スキーマに適合していることと、中身が正しいことは別問題です。スキーマ検証を通った出力をそのまま DB に入れているパイプラインでは、ここで挙げられた失敗パターンを一度点検しておく価値があります。
出典 @TDataScience↗
RAG
@TDataScience
RAG の「理由なき無回答」をどう防ぐか
Towards Data Science が、Kezhan Shi 氏の記事を紹介しました。ハルシネーションは注目されがちですが、RAG システムが根拠を示さずに「回答なし」とだけ返すケースも問題だとして、その原因と防ぐための方法を整理しています。
メモ
「答えない」は安全側の挙動に見えますが、ユーザーからすると原因が分からず改善もできません。検索が失敗したのか、根拠が不足したのかを区別して返す設計は、RAG の運用品質に直結します。
出典 @TDataScience↗
Engineering
@TDataScience
データサイエンティストが押さえるべき AI スキル 5つ:RAG、モデルルーティング、ガードレールなど
Towards Data Science が、Sara Nobrega 氏の記事を紹介しました。職務内容が変わり続ける中で、データサイエンティストが価値を保つために注力すべき AI スキルを5つ挙げています。RAG、モデルルーティング、ガードレールなどが含まれます。
メモ
モデルの学習そのものより、複数モデルの使い分けや出力の制御といった「LLM を組み込む側」のスキルが並んでいる点が象徴的です。
出典 @TDataScience↗