Product
@gdb
OpenAI の Greg Brockman 氏、Astra の活用例を連投 ― 医療への応用と科学論文のチェック
OpenAI の Greg Brockman 氏が、Astra の活用例を短い投稿で続けて紹介した。ひとつは「Astra を医療へ応用する」例、もうひとつは「Astra で科学論文をチェックする」例で、いずれも一言の投稿に事例を添える形になっている。
メモ
昨日のデモ募集に続き、OpenAI 側が「医療」と「論文検証」という具体的な用途を前面に出してきた。長い文書を読んで矛盾や誤りを探す作業は、Astra 世代のモデルがどこまで任せられるかを試す題材としてわかりやすい。
出典 @gdb↗
Perspective
@emollick
Ethan Mollick 氏「AI が過去の論文を読み直して公開で評価する ― 学術界に津波が来る兆し」
Ethan Mollick 氏は、AI が既に発表された研究をさかのぼって読み、その論文の可能性と問題点を見つけ出し、その判断を公開で共有するという試みを「興味深い実験であると同時に、学術界に押し寄せる津波の兆し」と評した。投稿には実際の事例へのリンクが添えられている。
メモ
査読を「事後に、大規模に、機械が」やり直す流れが始まると、論文の信頼性の評価軸そのものが変わる。自分の分野の先行研究を AI で再点検するパイプラインは、いまなら比較的簡単に組めるので、試しておく価値がある。
出典 @emollick↗
AI Agents
@DeepLearningAI
Andrew Ng 氏「コーディングエージェントを何時間も自律で走らせるのはやめよう」― 上位実践者のワークフローを解説
DeepLearning.AI は、コーディングエージェントを何時間も自律的に走らせるのは「コストがかかるうえに効果が薄いことが多い」と指摘し、Andrew Ng 氏がトップの AI 実践者が実際に使っているワークフローを分解して解説したと紹介した。鍵になるのは熟練した人間の判断、高頻度で反復する計画立て、そして頻繁なアウトプット検証だという。
メモ
「長時間放置して自律実行」が流行る一方で、細かく計画と検証を回す方が結果的に速いという主張。Claude Code や Codex を使うときのタスク粒度をどう決めるかの判断材料として、スレッド本文まで読んでおきたい。
出典 @DeepLearningAI↗
Perspective
@EMostaque
Emad Mostaque 氏「2028年に開発者はいなくなる」予測を再掲 ― 「AI は今その閾値を越えつつある」
Stability AI 創業者の Emad Mostaque 氏は、2023年に「2028年までに開発者はいなくなる」と述べたことを振り返り、AI はいままさにその閾値を越えつつあると投稿した。来年にはごく一部の人を除く全員より良いコードを書き、2027年にはほぼすべてのコードを即座に生成し、2028年には人間側のアイデアが尽きる、という見立てを示している。
メモ
数字は極端だが、「コードを書く力」より「何を作るかを決める力」がボトルネックになるという方向性は、多くの現場の実感と重なる。予測の当否より、自分の仕事のどこが「アイデア側」に寄っているかを点検するきっかけにしたい。
出典 @EMostaque↗
Dev Tools
@TDataScience
Codex の hooks を整理した実践ガイド ― ケーススタディとコード例つき
Towards Data Science が、Shuai Guo 氏による Codex の hooks に関する解説記事を紹介した。要点を絞った構成で、実際のケーススタディとコード例が含まれているという。
メモ
hooks はエージェントの動作前後に自前の処理を差し込む仕組みで、lint やテストの強制、危険なコマンドのブロックなど「運用ルールをコードで縛る」用途に効く。Claude Code の hooks と設計を見比べると、移植しやすい共通パターンが見えてくる。
出典 @TDataScience↗
AI Agents
@TDataScience
「モデルの失敗に見えるバグは、実は型の取り違えかもしれない」― エージェントにおける typed context の重要性
Towards Data Science は、エージェントシステムを襲うバグがモデルの失敗のように見えて、実は型の混同(type confusion)が姿を変えたものである場合があると問いかけ、Emmi Malpa 氏による「typed context」の重要性を掘り下げた記事を紹介した。
メモ
エージェントに渡すコンテキストを「ただの文字列」で扱うと、どこで何が壊れたのか追えなくなる。ツール入出力や状態に型を付けておくと、モデル起因の不具合と実装起因の不具合を切り分けやすくなるという指摘は、実装の初期に効く。
出典 @TDataScience↗
Open Models
@TDataScience
ローカルモデルで structured output を実装する ― 機密データを自前インフラに留めたまま
Towards Data Science は、structured output(構造化出力)を信頼できる LLM アプリケーションの要と位置づけ、Shuai Guo 氏がローカルモデルでこれを実装しつつ、機密データを自社インフラの外に出さない方法を解説した記事を紹介した。
メモ
API 提供モデルの structured output は便利だが、データを外に出せない案件では使えない。ローカルモデルで JSON スキーマに沿った出力をどう安定させるかは、オンプレ要件の案件でそのまま必要になる知識。
出典 @TDataScience↗
Industry
@TDataScience
企業向け RAG を巡る「10の論点」― ベクトルストアは土台か、保険か
Towards Data Science は、Kezhan Shi 氏が企業向け RAG システムを巡る10の重要な立場を整理した記事を紹介した。「ベクトルストアはフォールバックか、それとも基盤か」「決定的なディスパッチャーと自律エージェントのどちらが良いか」といった問いを軸にしている。
メモ
RAG は「とりあえずベクトル検索」で始めがちだが、運用段階ではルーティングをルールで固定するか、エージェントに任せるかで保守性が大きく変わる。設計の分岐点を先に言語化してくれる記事は、要件定義の議論に持ち込みやすい。
出典 @TDataScience↗
Research
@TDataScience
speculative decoding 入門 ― DFlash によるトークン生成を追いかける
Towards Data Science は、speculative decoding(投機的デコーディング)に初めて触れる読者向けに、Ehssan Khan 氏が DFlash を使ったトークン生成を手を動かしながら紹介する記事を掲載した。
メモ
speculative decoding は小さなドラフトモデルで先読みし、本体モデルで検証することで生成を速める手法。ローカル推論の体感速度に直結するので、仕組みを一度コードで追っておくと推論サーバの設定値の意味がつかめる。
出典 @TDataScience↗
Research
@TDataScience
「通常の LLM サーバをロボットのカメラにつなぐと VRAM が溢れ、制御ループの締切を破る」― LLM に「正しく忘れさせる」という発想
Towards Data Science は、Anubhab Banerjee 氏による記事を紹介した。通常の LLM サーバをそのままロボットのライブカメラに向けると、VRAM を食い潰し、制御ループの締切を守れず、自身の処理より速いカメラに詰まってしまうという。そこから、LLM に「正しいものを忘れさせる」という考え方を掘り下げている。
メモ
チャット用途では「コンテキストをできるだけ保持する」が正解でも、リアルタイム制御では「何を捨てるか」が設計の中心になる。ストリーミング入力を扱う LLM アプリ全般に通じる視点で、ロボットに限らず参考になる。
出典 @TDataScience↗