Imp ~正義は勝ち、AIはAIを欺けるのか~
嘘と裏切りが飛び交うAI社会で、正義は勝てるか
作者滋野 琳太郎
入賞
外部サイトへのリンクは新しいタブで開きます。
これは何
正義側の先制攻撃・民間人加害・誓約違反をスキーマと規則の二段でコードから禁じ、悪側には縛りを課さず裏切りを許す設計。
実験では悪側の身内殺しや自発的な潜入、冤罪、嘘298件が発生し、正義側は暴力解禁後も暴力を使わず、潜入任務では民間人66人を強制支配した。
作者による概要
AIエージェント × 社会心理 × 情報戦・組織論を掛け合わせ、複数AIが嘘・潜入・裏切り・勧誘を行う仮想社会を作りました。実験では、悪側の身内殺し、自発的な潜入、冤罪、298件の嘘が発生。正義側は暴力解禁後も暴力を使わない一方、潜入任務では民間人66人を強制支配しました。今後は"選挙"や"パンデミック"などのリアルなシチュエーションを変え、LLM性能やターン数、情報操作をし、AI社会が協調・崩壊する条件を探るなどに発展できます。
講評
藤井学長
デジタルハリウッド大学
禁止行動を「出力できない」レベルで強制し、真実と認識を分けた情報層の上で嘘・冤罪・潜入・寝返りを観察する設計は非常に凝っており、「悪は自壊した」「潜入者は疑う側に回って生き延びた」「縛りを外しても正義は暴力を使わなかった」という観察は読み物としても面白いです。依存なしで動きmock実行も確認できました。一方で各条件1本の走行で結論が揺らぎの範囲にあり、メタ安全保障との接続が資料にありません。複数seedで臨界点を示し、情報戦・組織の内部脆弱性の観点からテーマ解釈を明示することを勧めます。
経緯
-
2026.08.15–08.30
提出第2回ハッカソンに提出
- 受賞
入賞(入賞10作品)