Product
@emollick
Fable 5.1 が「ブルータリズム建築の都市建設ゲーム」をワンショットで生成
Ethan Mollick が、建物を直感的に操作できる都市建設ゲームを作れという一つのプロンプトを Fable 5.1 に与え、一発で動くアプリ(brut-city.netlify.app)が出てきたと投稿しました。1年ちょっと前の GPT-5 による同じプロンプトの結果と並べて比較しており、出来は「かなり良い」との評価です。
メモ
同一プロンプトで世代を比較している点が参考になります。プロトタイプを「作って捨てる」コストが下がり続けているので、仕様を固める前にまず生成して触る進め方が現実的になってきました。
出典 @emollick↗
Open Models
@DeepLearningAI
オープンモデル GLM-5.3 がサイバーセキュリティ能力で Claude Mythos に迫る
Anthropic の計測によると、ExploitBench のエクスプロイト課題で GLM-5.3 は12%、Claude Mythos は14%を解決し、オープンモデルがクローズドモデルに肉薄しています。さらにトークン費用わずか20.40ドルで、Google Chrome の最近のセキュリティ上の欠陥を見つけたとのこと。Andrew Ng が今週のレターで取り上げています。
メモ
攻撃側のコストが数十ドル規模まで落ちているという話で、オープンモデルで同じ水準が出るなら利用規約による抑止は期待できません。自分たちのコードにも同種のスキャンを先に回しておく発想が要ります。
出典 @DeepLearningAI↗
AI Agents
@TDataScience
検索のみ・決定論的プランナー・ハイブリッドの3方式を同じ9タスクで比較
@emmimalpa による実践的な解説記事。検索(retrieval)だけの構成、決定論的なアクションプランナー、そして検索とアクションをつなぐハイブリッドの3バージョンを実装し、同一の9タスクを全てに通して比較しています。検索と実行のあいだのギャップをどう埋めるかがテーマです。
メモ
RAG から「実際に操作するエージェント」へ進む段階で必ずぶつかる設計分岐です。同じタスクセットで3方式を並べた比較は、自前の構成を決めるときの叩き台になります。
出典 @TDataScience↗
Research
@TDataScience
生成重視モデルと意思決定ベースのモデル、Jev 登場で選択肢が増える
Jev の登場により、実務者は生成に重きを置いたモデルと、意思決定ベースのモデルを選べるようになったという指摘です。@nhu_hoang が両アプローチを十分にテストした上での技術的な比較記事を公開しています。
メモ
「とりあえず生成モデル」で済ませてきた用途に別系統の選択肢が出てきた、という話。用途ごとにどちらが向くのか、実測ベースの比較は目を通しておきたいところです。
出典 @TDataScience↗
AI Agents
@TDataScience
コーディングエージェントの出力が読めない問題に向き合う
エージェントがターミナルを大量のテキストで埋め尽くすと、本当に重要な情報を見つけるのが難しくなります。Eivind Kjosbakken が、コーディングエージェントの「伝え方」を改善することでワークフロー全体の効率が上がる方法を解説しています。
メモ
エージェントを日常的に回していると、精度よりもログの可読性がボトルネックになる場面が増えます。出力設計そのものを改善対象として扱う視点は実務的です。
出典 @TDataScience↗
Research
@TDataScience
時系列予測で必要なのは「次の1点」ではなく一定期間の予測
「実際のアプリケーションで必要なのは次の値ひとつではなく、一定の期間にわたる予測だ」という問題設定から、Waleed Esmail が自己回帰的なロールアウトと不確実性の伝播を掘り下げた解説記事を公開しました。
メモ
1ステップ先の精度だけ見て良しとしてしまう失敗はよくあります。予測を自分の出力に食わせていく構造では誤差がどう積み上がるかを押さえておく必要があります。
出典 @TDataScience↗
Research
@TDataScience
AI生成テキストの電子透かし、3方式を Python で実装して耐久性を検証
テキストへの電子透かしは、AIが生成した文章の出所を特定する実用的な手段になりつつあります。Chien Vu Minh が3つの透かし方式を Python で実装し、コピー・編集・言い換えを経てもどれだけ残るかを検証しています。
メモ
生成物の由来を追えるかどうかは、社内で生成テキストを扱うときの実務的な論点です。言い換えに耐えるかどうかという検証軸が、使えるかどうかの判断材料になります。
出典 @TDataScience↗
Research
@TDataScience
クラス分離を保ったまま次元を削る ― LDA を不動産の実例で
クラス間の分離を意識しながらデータセットを縮約すると何が起きるのか。Carolina Bento が、不動産を題材にした実例を通して LDA(線形判別分析)を解説しています。
メモ
LLM 中心の話題が続く中で、分類の前処理として地味に効く手法です。特徴量が増えすぎた既存モデルを整理するときの基礎として、押さえておくと腐りません。
出典 @TDataScience↗
Perspective
@TDataScience
データサイエンティストが今から馴染んでおくべき技術領域
量子コンピューティングやクラウドアーキテクチャから、デジタル・ソブリンティ(データ主権)まで。@rpdesai24 が、データサイエンティストがもっと通じておくべきだと考える技術トピックを挙げています。
メモ
モデルの中身よりも、どこで動かし誰がデータを握るかという周辺領域の話。データ主権の観点は、国内で外部AIサービスを選ぶときにも直結します。
出典 @TDataScience↗