2026-08-15 LLMのロール識別における入力差分 複数のLLMを対象とした研究で、ユーザー入力やツール出力に思考過程を模した文章を置いた場合、通常条件と比べて内部probe上で思考過程に近い表現が維持され、攻撃成功率が上昇する結果が報告された。文章の意味を大きく変えずに文体・語彙・構文を変更すると攻撃成功率が低下する結果も示されている。記事では訓練による解消困難性が強く示されているが、研究では追加訓練による検出改善の可能性も示されており、将来のモデルや異なる実装でも同様の差分が残るかは未確定として記録する。 LLM入力境界 ロール識別 Prompt Injection AIエージェント 権限境界 業務AI運用