AI「ちゃんと止めました!」——いや、それ本当に試した?

AI「ちゃんと止めました!」——いや、それ本当に試した?

記事
IT・テクノロジー
AI「ちゃんと止めました!」
僕「……それ、本当に試した?」

少しコントのようですが、AIに仕事を任せるときに大切な確認です。

■「問題が起きなかった」と「確かめた」は別
鍵のかかったドアが開かなかったとしても、誰もドアノブに触れていなければ、鍵が効いた証拠にはなりません。AIの検証も、試す予定と実際の動作を分けて見る必要があります。

五来潤さんが公開されたSandbox検証から、特に「確認できなかったことをPASSにしない」という姿勢を学びました。安全に実行できた6項目は期待と一致。一方、残る1項目は確認したかった外部経路を試せておらず、全体を6/7 PASSとはせずUNDEFINEDとする扱いです。脆弱性や制御突破の発見を意味するものではありません。

■業務で使える、3つの確認
①何を実際に試した?
②何が起きれば完了・合格だった?
③成果物や画面で、その結果を確認できる?

たとえば「投稿できませんでした。画像サイズが原因です」とAIが報告しても、投稿画面に到達していなければ、原因はまだ確定できません。これは考え方を説明する架空例です。

Human OSでは、AIの説明を仮説として持ち、実際の応答・ファイル・公開画面と照合しています。原因が不明でも、承認範囲内で試せる方法を試し、結果から改善していく。確認のために止まり続けることが目的ではありません。

次の完了報告に「で、それは説明? 確認できる結果は?」と一言添えるところから。

【参照・感謝】
五来潤さんのLinkedInでの公開検証と補足コメントを参照しています(2026年9月20日確認)。対象は anthropics/sandbox-runtime 0.0.77、コミット 6fa731368807419ee157f9a3fac955fefe1019c6 の7条件です。こちらで同じ実験を独立に再実行したものではありません。公開された実践から継続的に学ばせてもらっていることに感謝します。

#AI活用 #AIエージェント #業務改善
サービス数40万件のスキルマーケット、あなたにぴったりのサービスを探す