人類滅亡ほどではないが、AIに地味にダマされた件|勝手に難易度をハードにされた話
たまたま、Claudeで使えるおまけのクーポンが余っていました。
せっかくなので、普段ならあまり使わないFableを試してみることにしました。
題材にしたのは、当時ちょうど進行していた企業間のトラブルです。
具体的な会社名や案件内容はここでは伏せますが、こちらには契約関係、金銭、会社運営など複数の論点がありました。
せっかく高性能なAIを使うなら、
「こちらが見落としているリスクを徹底的に洗い出してほしい」
という使い方が面白そうです。
そこで、
相手側が取り得る行動。
こちらの弱点。
最悪の場合に起こり得ること。
その場合の損失。
などをかなり広く検討させてみました。
返ってきた分析は、かなり立派でした。
制度上可能な手段。
相手が合理的に行動した場合のシナリオ。
こちらへの影響。
対抗策。
さらに、一部には発生確率のような数字まで付いていました。
読んでいると、
「なるほど。そこまで考えておかないといけないのか」
という気になります。
AIが示した論理自体も、ぱっと見ではかなり筋が通っています。
私は少し身構れました。
ところが、その後しばらく現実の相手を観察しているうちに、妙な違和感が出てきました。
AIが想定している相手。
現実の相手。
なんか違う。
かなり違う。
そしてある時、理由が分かりました。
AIの中の相手、現実よりだいぶ優秀だったのです。
ゲームで言えば、こちらが頼んでもいないのに、
勝手に難易度をハードへ変更されていました。
AIは嘘をついていたわけではない
最初に重要なことを書いておきます。
今回、AIが明らかな嘘をついたわけではありません。
存在しない法律をでっち上げた。
架空の会社制度を作った。
という単純なハルシネーションの話ではありません。
むしろ厄介だったのは逆です。
一つ一つの話は、
「制度上は可能」
「理屈としてはあり得る」
「合理的な相手なら検討するかもしれない」
という範囲に入っていました。
だから読んでいて説得力があります。
問題は、その先です。
ある手段が制度上可能だとしても、
実際に相手がそれを行うまでには、いくつもの段階があります。
たとえば、
- その選択肢の存在に気付く
- 自分たちに有利だと判断する
- 必要な情報を集める
- 専門家へ相談する
- 組織内で意思決定する
- 必要な手続きを準備する
- 途中で面倒にならず実行する
- 反撃や副作用も考えた上で最後まで進める
必要があります。
AIは「制度上できる」という入口から、その後の工程をかなり滑らかにつないでいました。
しかし現実の人間や組織は、そんなに滑らかには動きません。
「できる」と「やる」の間には巨大な距離がある
これはAIに限らず、リスク分析全般で重要な違いです。
ある行動が、
可能である
ことと、
実際に行われる
ことは別です。
さらに細かく分けるなら、
制度上可能。
技術的に可能。
経済的に合理的。
相手がその方法を知っている。
実行する能力がある。
実行する意思がある。
実際に着手する。
最後まで継続する。
は全部違います。
今回のAI分析では、この途中の階段がかなり省略されていました。
「相手にとって合理的な戦略」
が、
「相手が実際に取り得る戦略」
へ、ほぼそのまま変換されていたのです。
しかし実際の相手の行動を時間をかけて観察すると、
説明が整理されていない。
対応が途中で止まる。
期限がずれる。
一貫した戦略というより、その場その場で動いているように見える。
といった情報が増えてきます。
そうなると、
高度な戦略を思いつき、関係者をまとめ、専門家を使い、計画的に実行する
というAI側の前提そのものを疑う必要が出てきます。
AIは相手の「能力値」を勝手に補完することがある
今回の体験を一言で表すなら、
AIが相手の能力値を勝手に補完していた
ということだと思います。
AIは、与えられた条件から論理的に次の手を考えるのが得意です。
こちらが、
「相手側なら何をするか」
と聞けば、
かなり合理的な相手として戦略を考えてくれます。
それ自体は便利です。
チェスなら、それでいい。
相手が最善手を打つ前提で考えることには意味があります。
しかし現実の企業、人間関係、行政、取引先との交渉では、
相手が最善手を打つとは限りません。
そもそも最善手を知らない。
知っていても面倒だからやらない。
内部調整ができない。
責任を負いたくない。
別件で忙しい。
途中で忘れる。
感情で動いて方針が変わる。
ということが普通にあります。
人間はゲームAIではありません。
ところが生成AIへ、
「相手側の最善戦略を考えて」
と頼むと、
現実の相手ではなく、
その条件下で合理的に動く仮想プレイヤー
が生成されます。
ここを現実の人物と混同すると、難易度が勝手に上がります。
高性能なAIほど、このズレが見えにくい
ここが今回いちばん面白かったところです。
性能の低いAIなら、
雑な話。
明らかな間違い。
論理の飛躍。
が目立つので、こちらも警戒します。
ところが高性能なAIは、
前提。
制度。
因果関係。
リスク。
対抗策。
まできれいにつないできます。
文章も自然です。
そのため、
前提が少しズレたまま、高品質な分析だけが完成する
ことがあります。
これは、単純な間違いより見抜きにくい。
AIが間違っているというより、
こちらが分析対象としていた現実と、
AIが内部で組み立てた世界の難易度設定が違っているのです。
性能が上がるほど、その仮想世界の整合性も高くなります。
だから、
「ずいぶん筋が通っている」
こと自体が、現実への適合を保証してくれるわけではありません。
難しい分析の方が重要に見える罠
もう一つ、この経験で気付いたことがあります。
AIは非常に難しい論点を扱えます。
法律。
契約。
財務。
組織。
制度。
複数シナリオ。
そういったものを組み合わせた分析は、見た目にも高度です。
一方、現実から得られる情報は地味です。
返事が来ない。
説明が毎回少し違う。
期日を過ぎても動かない。
書面が整理されていない。
話が前回から進んでいない。
こういう情報には、知的な派手さがありません。
しかし、次に相手が何をするかを考えるとき、
後者の方が重要な場合があります。
つまり、
情報の難しさと、意思決定上の価値は同じではありません。
複雑な制度論を10個調べるより、
その相手が過去3か月で実際に何をしたか
を確認する方が役に立つことがあります。
AIを使っていると、この順番が逆転しやすい。
高度な回答が返ってくるほど、
高度な論点ほど重要なのだ
と感じてしまうからです。
数字が付くと、さらに本物っぽくなる
今回もう一つ印象的だったのが、確率です。
AIへリスク分析を頼むと、
「このケースは○%程度」
のような数字を出すことがあります。
数字が付いた瞬間、分析は急に科学っぽく見えます。
しかし、その数字には注意が必要です。
たとえば、
相手がその方法を知っている確率。
専門家へ相談する確率。
社内で意思決定できる確率。
本当に実行する確率。
最後まで継続する確率。
という各段階について、実測データがあるわけではありません。
対象となる会社と似た企業を何百社も観測した統計があるわけでもありません。
その状態で出てくる「30%」と、
大量の実測データから計算された30%
は意味が違います。
文章なら、
「可能性はあるが、どの程度起きるかは分からない」
と読めます。
ところが30%と書かれると、
何らかの測定結果のように感じます。
つまり、
数値化によって不確実性が減るのではなく、不確実性が見えにくくなる
ことがあります。
最悪ケースを考えること自体は悪くない
では、AIに最悪ケースを考えさせない方がいいのか。
私はそうは思いません。
今回も、
「そんな手段も制度上は存在するのか」
と知ること自体には価値がありました。
自分では思いつかなかった論点を洗い出す。
反対側の立場から考える。
穴を探す。
最悪ケースを確認する。
これはAIが非常に得意な使い方です。
問題は、
列挙された可能性に、そのまま優先順位まで与えてしまうこと
です。
AIには、
「何があり得るか」
を広く探してもらう。
その後、
「この相手が実際にそれをやる証拠はあるか」
を現実の観測で確認する。
この二段階を分けた方がよさそうです。
「可能性」と「優先順位」を別々に聞く
それ以来、重要な判断ではAIへの聞き方も少し変えています。
たとえばリスクを考える場合、
単に、
「相手が取り得る行動を分析して」
と頼むだけではなく、
次のように分けます。
制度上・理論上できること
まず可能性の全集合を出します。
ここでは広くて構いません。
その行動に必要な前提
専門知識。
資金。
社内承認。
外部専門家。
時間。
継続的な実行能力。
などを書き出します。
現時点の観測事実
実際に相手が何をしたか。
何をしていないか。
過去の行動に一貫性があるか。
を別枠にします。
仮説と事実を分離する
「合理的ならこうする」
と、
「実際にそう動いている」
を混ぜません。
数字に根拠がなければ無理に確率化しない
高・中・低。
要監視。
現時点では優先度低。
程度の順序尺度の方が、無理な精密化を避けられる場合があります。
こうするとAIは、
「最悪ケース製造機」
ではなく、
リスク空間を広げる道具
として使いやすくなります。
AIは専門家の代わりというより「異様に有能な部下」に近い
今回の件以外でも、AIを実務で使っていると、
AIは答えをくれる機械というより、
かなり有能だが、現場を直接見ていない部下
として扱う方がしっくりきます。
資料を渡せば大量に読みます。
論点を整理します。
反論も考えます。
コードも書きます。
こちらが気付かなかった穴も見つけます。
ただし、
現場の空気。
相手の性格。
組織の癖。
誰が本当に意思決定しているか。
面倒なことを最後までやり切れる組織なのか。
といった情報は、入力しなければ分かりません。
そして入力しても、それをどの程度重く見るべきかは簡単ではありません。
だから高性能なAIほど、
「任せられる範囲が広がる」
と同時に、
「何を任せないかを決める必要も増える」
のだと思います。
建設DXでも似たことは起こる
これは企業間トラブルだけの話ではありません。
建設DXでも、
「この会社ならAPI連携すればいい」
「マスタを統一すれば解決する」
「現場で入力すれば二重入力はなくなる」
「このSaaSを導入すれば業務フローを標準化できる」
といった、論理的にはきれいな答えがあります。
しかし現実には、
発注者指定様式を変えられない。
現場ごとに入力粒度が違う。
元請ごとのルールがある。
過年度データがばらばら。
特定担当者しか知らないExcelが残っている。
という事情があります。
理論上の最適解だけを考えると、
現実の組織を勝手に高性能化してしまいます。
この点では、
AIによる経営相談も、
建設DXの導入設計も、
同じ問題を持っています。
現実の組織能力を無視して、理想的なプレイヤーを前提にしないこと。
これはかなり重要です。
AIにダマされたのではなく、難易度設定を見落とした
タイトルでは、
「AIに地味にダマされた」
と書きました。
もちろん、AIに人を騙そうという意思があるわけではありません。
より正確には、
AIが作った非常に整合的な仮想世界を、現実の世界と同じだと思ってしまった
という話です。
AIの分析では、
相手は選択肢を知っている。
合理的に比較できる。
必要な手続きを調べられる。
関係者を動かせる。
そして最後まで実行できる。
そんな能力が暗黙に付与されていました。
私はそこに気付かず、
AIが設定したハードモードの相手と戦う準備を考えていた。
ところが現実を観測してみると、
そもそも同じゲーム設定ではなかった。
これが今回の「地味にダマされた件」の正体です。
まとめ
AIのリスクというと、
事実誤認。
ハルシネーション。
著作権。
情報漏えい。
あるいは人類滅亡のような大きな話まで、さまざまな論点があります。
それらに比べれば今回の話はかなり地味です。
しかし、実務ではこの種のズレの方が頻繁に遭遇するかもしれません。
AIの回答が、
法律上正しい。
論理的に正しい。
合理的である。
ことと、
現実の相手がそのとおり動く
ことは別です。
AIには、
可能性を探す。
反論を作る。
見落としを探す。
最悪ケースを洗い出す。
ところまでかなり任せられます。
一方、
その可能性を今どの程度重視するか。
現実の相手に実行能力があるか。
観測事実と整合するか。
という優先順位付けは、別の工程として考えた方が安全です。
高性能なAIほど、雑な間違いは減っていきます。
その代わり、
少し違う前提から、ものすごく上手に正論を組み立てる
という種類のズレは見抜きにくくなります。
AIが怖いのは、人類を滅亡させる時だけではありません。
たまに、
こちらが頼んでもいないのに敵のステータスを盛って、
ゲーム難易度をハードへ変更してくる。
そんな地味な事故もあります。
ダウンロード
維持DXでは、国交省様式を対象とした橋梁点検支援ツールを無料・機能制限版として公開しています。
実際の処理イメージを確認したい方は、以下のフォームからお申し込みください。
フォーム送信後に、ダウンロード案内をお送りします。
ご注意
ダウンロードしたExcelでマクロが実行できない場合は、
右クリック → プロパティ →「許可する」 をチェック後、再度開いてください。Windowsのセキュリティ機能により、初回実行時にマクロがブロックされる場合があります。
