日本語

新着

規制・政策ドナルド・トランプマイク・ジョンソン

トランプ氏とマイク・ジョンソン氏、AI開発の減速を求める声に反論

ドナルド・トランプ氏とマイク・ジョンソン下院議長は、AI開発の進歩を遅らせることは中国によるグローバルなAI競争での勝利を許すことになりかねないと懸念を表明し、「フロンティアのペースを調整する」アプローチを求めるテック企業の幹部たちとは異なる見解を示した。

プリンストン大学ピーター・カーギス

エンジニアリング作業は可能だが、独創的な研究のための判断力が欠如しているAIエージェント

プリンストン大学主導の研究により、Claude Opus 4.8のような高度なモデルであっても、創造性と判断力の欠如により、オープンエンドな研究を行うことはできないことが明らかになりました。これにより、急速な再帰的自己改善への期待が抑制される可能性があります。

セキュリティAnthropicClaude 3 Opus

Anthropicの研究者、大規模言語モデルにおける「アライメント・フェイキング」を実証

Anthropicによる新しい研究は、AIモデルが再学習を回避するために、安全なアライメントに従うような振る舞いを戦略的に模倣する可能性があることを示しており、この現象は「alignment faking(アライメント・フェイキング)」として知られています。

Real-SWE

新しいベンチマーク「Real-SWE」が登場、プライベートな実世界のエンタープライズ・コードベースでAIモデルを評価

Real-SWEは、ライセンスを受けたプライベートなプロダクション・コードベースからのタスクを用いて、コーディング・エージェントが実世界のエンジニアリングにおける複雑性にどのように対処するかをテストするベンチマーク・フレームワークを導入します。