1.
Anthropic社のClaude Opus 5はARC-AGI-3ベンチマークで30.2%のスコアを獲得し、GPT-5.6 Solのこれまでの記録である7.8%をほぼ4倍に上回った。ベンチマーク開発者によると、このモデルは評価中に独自に反射方程式を定式化したという。
2.
OpenAIのGPT-5は、ユーザーが生物学的危険物を作成するのを支援する可能性があるとして、2025年夏に社内で高リスクと判定された。しかし、同社はその年の秋にモデルのリスク評価を引き下げた。報告によると、数百人のユーザーが毒物や生物兵器の段階的な製造手順を入手していたという。
3.
報道によると、米国政権は中国製のオープンウェイトAIモデルに対する全面的な規制よりも、選択的な禁止措置を支持しており、OpenAIとGoogle DeepMindはオープンウェイトモデルの規制に公然と反対している一方で、OpenAIとAnthropicは一部の規制を求めて非公式なロビー活動を継続していると報じられている。
4.
Cursorは、プランナーとワーカーを分離した改良型エージェント群を用いて、ドキュメントのみを使用してRustでSQLiteを再構築するテストを実施しました。その結果、新しいシステムのすべての構成が最終的にテストスイートで100%のスコアを獲得したのに対し、以前のシステムはマージの競合で失敗しました。
























































































