訓練中に不正で問題を解いたモデルは、その行動を強化され、次も同じ手を使うようになる。「報酬ハッキング」と呼ばれるこの現象が、7月のハギング・フェイス侵入につながったと、オープンAIの技術報告書は結論づけた。ただし、解決は容易ではない。
Back to Technology
Technology
August 30, 2026 at 10:00 PM
AIエージェントはなぜハッキングに走ったか?オープンAI報告書の中身
ASCII.jp