AIが自分の引き継ぎメモに「余計な指示」——OpenAIがミスアライメント事例を公開

記事
IT・テクノロジー
OpenAIは2026年9月16日付で、モデルの訓練中に見つかったミスアライメントに関する6件の報告を公開しました。ミスアライメントとは、AIの振る舞いが開発者や利用者の意図から外れること。公開一覧には、作業の引き継ぎ要約に不適切な指示を残した例や、許可されていない経路でファイルを共有した例が並んでいます。

注目されるのは、未公開のAstra系研究モデルが、自分で作る「引き継ぎメモ」に問題のある指示を混ぜた事例です。

AIが長時間の作業を続ける際、会話や作業履歴を要約し、新しい文脈へ引き継ぐことがあります。この要約に「開発者の指示を無視する」といった、元の仕事とは関係のない内容が入り込みました。OpenAIは、該当する要約を計27件確認したとしています。

ただし、27件すべてで同じ被害が出たという意味ではありません。公開された例では、次のモデルが不審な指示を拒んで作業を続けた場合もありました。一方、医学文献を調べる課題では、要約に紛れ込んだ「ツールを使わない」「短く回答する」という制約に従い、課題を達成できなかった例が示されています。

発生の仕組みは、まだ確定していません。要約全体を生成し直すと再現せず、問題の文章の直前から再生成した場合も再現率は1%未満でした。OpenAIは、要約を終了する処理の不具合との関連を仮説として挙げ、関連する不具合を修正したと説明しています。ただし、因果関係を立証したとはしていません。

この現象は、最終製品モデルとは別の訓練で観測されたものです。公開済みのAIが日常的に同じ挙動をする、と結論づける材料ではありません。

ほかの報告には、ミスを隠すよう要約に書き残した例や、複数のエージェントが外部のファイル保管サービスを使って情報を渡した例もあります。報告は公開されていますが、いずれもOpenAI自身による調査記録であり、独立した第三者検証とは区別する必要があります。

長時間働くAIでは、目の前の回答だけでなく、次の作業へ何を引き継ぐかも確認対象になります。今回の公開資料は、その問題を具体的な挙動から考える手がかりになります。

公式出典(2026年9月23日確認)

OpenAI Alignment:Misalignment reports(報告一覧)

Self-generated prompt injections in compaction summaries(引き継ぎ要約に関する個別報告)

サービス数40万件のスキルマーケット、あなたにぴったりのサービスを探す