AI 生成画像はなぜ一目で AI とわかるのか
問いは木下が出したもので、答えは Claude Code と調べて書いたものです。
Q(木下):最近はメニューやビラなどが AI 画像生成の場合が多いけど、なんで AI 生成の画像ってあんなに AI 生成だってわかりやすいんだろう。
A:主因は「モデルが分布の平均を出すこと」と「人の目が顔・手・文字・質感の微妙なズレに極端に敏感なこと」の組合せ。加えて、見抜けた画像しか記憶に残らない選択バイアスもある。
- 平均的で無難すぎる:生成モデルは学習データの「ありがち」を出す方向に働くので、被写体が真ん中、左右対称、全面ピント、傷も汚れも影の欠けもない状態になる。本物の写真には偶然の雑物(手前の指、背景の看板、テーブルの染み)が必ず混ざるが、AI 画像にはそれが無い。「きれいすぎて情報が無い」のが違和感の正体。
- 局所は正しいが全体が矛盾する:拡散モデルは隣り合う画素どうしの整合はうまいが、離れた場所の物理的一貫性(光の向き、影と反射の対応、窓の列の等間隔、皿の縁の連続性)を保証する仕組みが弱い。だから料理写真で皿の模様が途中で変わる、椅子の脚が本数と合わない、といった「見れば見るほど変」が起きる。
- 文字が読めない・崩れる:文字は1画素ズレただけで別物になる「離散的」な対象で、画像を連続値として扱う生成とは相性が悪い。日本語の看板やメニューの文字が漢字らしいが存在しない字になるのはこのため。ビラやメニューは文字と食べ物が主役なので、弱点が一番大きく出る媒体になっている。
- モデル固有の「デフォルト画風」:Midjourney の暖色で映画的なグロー、DALL-E の平坦でパステルなイラスト調、Stable Diffusion の彩度高めなど、各モデルには評価者が好む方向へ微調整された既定の見た目がある。皆が既定設定で出すので、街のビラが同じ癖を共有し、パターンとして学習されてしまう。
- 人の目が過敏な領域に当たる:顔・手・文字・肌や食品の質感は、人が進化的にも経験的にも最も細かく見分ける対象で、いわゆる不気味の谷はここで起きる。ビラは大きく印刷されるので粗が拡大される。
- 選択バイアス:手直しされたもの、実写と合成されたもの、写真風でなくイラスト風に振ったものは気づかれずに通り過ぎている。「AI 画像はわかりやすい」は「わかった画像だけ数えている」側面がある。
補足:見抜くときは、文字・手・影の向き・繰り返し模様の 4 点を順に見ると精度が上がる。逆に、こちらが作る側なら文字は後から本物のフォントで載せ、写真は実物を撮ってから AI で背景だけ整える、という使い分けが最も違和感を減らす。
← ふとした疑問の一覧へ