Create

Sign in to ReadmeX

Sign in to join communities, post, vote and chat.

New here?

Story

Why AI Image Generators Keep Defaulting to Beautiful Women

AI summary

An analysis argues that AI image generators repeatedly produce attractive women because model outputs reflect training-data distributions, human preferences for average faces, and user engagement patterns. It connects the phenomenon to the viral synthetic baseball spectator, the historical use of Lena Soderberg’s image in image-processing research, Lensa’s sexualized outputs, and permissive features such as Grok’s “Spicy” mode.

Why it matters: The pattern highlights how data, aesthetic scoring, and user behavior can reinforce biased defaults in generative image systems.

OpenAIGPT-4oGoogle

References 极客公园 · 虎嗅 AI

0
Source text虎嗅 AI · 10 min read
今年 5 月初,X 上一条五秒钟的视频火了。这是一场韩国职业棒球联赛转播,韩华鹰队对阵斗山熊队。镜头扫到看台上一个穿白上衣和牛仔裤的女人,翘着腿。某一刻,她似乎叹了口气,并移开了视线,看起来对比赛感到不满。视频配文是“普通韩国女性”。截至本文发布,视频播放量已经为 1525 万|视频来......

本文来自微信公众号: 极客公园 ,作者:汤一涛,编辑:靖宇,题图来自:AI生成

今年 5 月初,X 上一条五秒钟的视频火了。这是一场韩国职业棒球联赛转播,韩华鹰队对阵斗山熊队。镜头扫到看台上一个穿白上衣和牛仔裤的女人,翘着腿。某一刻,她似乎叹了口气,并移开了视线,看起来对比赛感到不满。

视频配文是“普通韩国女性”。截至本文发布,视频播放量已经为 1525 万|视频来源:X @kangminlee

但是很快一群资深球迷看出了不对劲。比分牌上写着,击球手是曹仁成(Cho Inseong),可曹仁成 2017 年就退役了,现在在斗山当教练。

此外,看台上的加油标语比斗山熊的官方口号多出一个字,像是 AI 生硬直译出来的。而这场转播,解说却是标准的美式口音,同样也很可疑。

这个女人确实不存在,她是由 AI 生成的。但视频被拆穿后没有消失,反而成了一个模板。大家把自己的脸塞进同样的转播画面,生成一张“被球场镜头抓拍到的自己”,并很快在社交网络上流行。

“被球场镜头抓拍到的自己”迅速成了流行模板|图片来源:RADII

每一次 AI 图像能力的增强,几乎都会跑出一个全民流行的爆款。比如 2025 年 3 月 GPT-4o 能画图了,满屏都是被重绘成吉卜力动画风格的照片;8 月底谷歌的 Nano Banana 上线,大家最爱的玩法是把自拍做成摆在电脑桌上的手办,用户两周里生成了 2 亿多张图。

爆款每次都换,大多是“把自己放进去”的玩法。但球场这一次,暴露了一个之前不那么明显的顺序:先是一个不存在的美女骗过了上千万人,然后才长出了人人可玩的模板。

美女不是偶然出现在场景里的配角,她更像一个默认值。

这个默认值比 AI 早了半个世纪。1973 年,正是图像数字化的早期,一群工程师要测试一项新的图像技术,他们选的也是一个美女。

一、互联网第一夫人

Lena Soderberg 的职业生涯始于在伊利诺伊州芝加哥,从事平面模特的工作。此前她以互惠生的身份,从瑞典移居到了美国。1972 年,她为《花花公子》杂志 11 月刊拍摄了中间插页。那期《花花公子》卖了 716 万多册,是这本杂志卖得最好的一期。

学过数字图像处理的人多半见过她:戴一顶宽檐帽,裸着肩侧过脸来看镜头。几十年里,数不清的图像压缩和处理算法拿这张脸做过测试。

Lena Soderberg 堪称赛博第一夫人|图片来源:SIPI IMAGE DATABASE

1973 年,南加州大学信号图像与处理研究所的研究者正手忙脚乱地为一篇研究论文寻找一张新图像。他们已经用完了常用的测试图像储备。据说,就在此时,一位同事拿着 1972 年 11 月的《花花公子》走了进来。看到研究人员们所处的困境,他从中间插页的顶部撕下一条 5.12 英寸的长条,把它送进了他们的扫描仪。

此后,这张图像在图像处理界得到了广泛使用,甚至成为行业默认的测试图片。

1996 年,IEEE 图像处理汇刊的主编戴维·芒森(David Munson)写过一篇短文,解释这张随手扫出来的图怎么就成了行业标准。他给了两条理由。第一条是技术上的,这张图细节、平坦区域、阴影和纹理样样都有,拿来测算法正合适。第二条他就更符合人性:这是一个有吸引力的女人的照片,一个以男性为主的研究圈子被它吸引,并不奇怪。

鉴于这张图片的来源,它的使用并非没有争议。1991 年,《花花公子》发现这张图上了一本学术期刊的封面,发函主张版权,最后还是放了手,让它继续在研究里使用。公司的新媒体副总裁说,既然已经成了一种现象,不如借势利用。

来自图像处理研究共同体内部,也有一些不一样的声音。他们指出,工程师不应使用任何可被视为贬低女性的出版物中的素材。

甚至 Lena 本人,也在纪录片《Losing Lena》中表态希望停用这张图。

在纪录片中,Lena 本人举着自己 50 多年前的那张著名照片|图片来源:IMDB

于是,2024 年 4 月 1 日起,IEEE 计算机协会不再接收使用这张图的论文。

此时距离那次扫描,已经过去了五十一年。

二、平均脸

现在,技术圈的考题早就换了。

AI 画不出一杯倒满的红酒,杯子里的液面总是停在中间偏上。AI 画钟表,指针也总会停在 10:10。原因是同一个:网上的红酒照片大多不是满杯的,而钟表广告的惯例就是摆在 10:10。模型会复刻训练数据的分布,摆脱不了数据的惯性。

对钟表广告为什么老是停在 10:10 最流行的解释是这看起来像一个“愉快的微笑”,不过在 1950 年代之前,更流行的做法是停在 8:20|图片来源:Reddit

红酒和钟表是“模型还不够好”的证据。但在美女这件事上,情况还不一样,“她”的惯性恰好和人的审美对齐了。

1990 年,心理学家 Judith Langlois 和 Lori Roggman 做了一个实验:把一批人脸用数学方法平均,合成一张新脸,再请人打分。结果,合成脸比参与合成的几乎每一张真人脸都更有吸引力,而且参与平均的脸越多,合成脸越好看。这个效应在男性脸和女性脸上都成立,在不同族裔中也成立。

论文的标题干脆就叫《有吸引力的脸只是平均的》(Attractive Faces Are Only Average)。

类似的观察更早也发生过。1877 年,有人写信告诉达尔文:把两张女士肖像用立体镜叠在一起,合成的脸每一次都明显更美。

生成模型的本质,其实就是学一个数据分布,再从分布的中心附近取样。换句话说,模型天生会画平均脸,而平均脸恰好就是人眼里的美。人类心理结合机器原理,就成为了美女作为 AI 默认值的技术根基。

2023 年澳大利亚国立大学的一项研究把这个碰撞推到了一个极端。心理学家发现,AI 生成的白人面孔被实验参与者判断为“真人”的次数,比真实的白人面孔还多。研究者称之为“AI 超真实”,解释是训练数据以白人为主,模型生成的脸更接近该群体的平均值,而接近平均的脸会被人感知为更典型、更像真人。

Langlois 的实验发表后挨过一个批评:合成脸好看,也许只是因为取平均的时候,顺手把皮肤上的斑点和瑕疵抹掉了。这个批评在 1990 年是方法论上的质疑。

但今天看来,它像一个预言。

AI 美女最典型的特征,恰好就是过分光滑的皮肤。三十多年后,事实核查机构教人识别 AI 图片,列出的破绽里就有一条:过度光滑的皮肤。批评者在三十多年前指出的那个统计伪影,成了 2025 年 AI 美女的特征。

三、石膏蛋

Lena 是一个实验室选出来的。今天的默认值,是从数据里长出来的。

2022 年底,修图应用 Lensa 的“魔法头像”功能突然爆红:上传几张自拍,AI 给你生成一百张不同风格的肖像。《麻省理工科技评论》的 AI 记者 Melissa Heikkilä 也用它生成了 100 张自己的头像,其中 16 张上身赤裸,另有 14 张衣着极少、姿势性感。而她的男同事,拿到的都是宇航员、探险家和发明家。在这个过程中,他们都没有给模型任何提示。

Melissa 通过 Lensa 生成的图片|图片来源:MIT TECHNOLOGE REVIEW

Melissa 在她的文章里解释,背后的模型拿互联网上抓来的图训练,而网上本来就到处是衣着暴露的女性照片。这就导致模型会把生成“衣着暴露的女性”作为默认值。

然后,用户的行为惯性会继续推动这个倾向。每一次的生成、保存、转发,都是一次投票。2025 年的一项研究统计了 AI 图像社区 Civitai 上的内容变化:NSFW(成人向)图片的占比,从 2023 年 1 月的 41% 升到了 2024 年 12 月的 80%。

最后,厂商会把这些投票写进了模型。为了让图像模型生成更讨人喜欢的图,厂商会训练一个“打分员”,学术上叫 reward model 或 aesthetic scorer。它的工作是学习人们觉得什么图好看,然后用这个标准去调教模型:得分高的方向多走,得分低的方向少走。

最常用的打分员之一叫 PickScore。它的训练数据来自一个网页应用:用户随手写一句提示词,系统给出两张图,用户挑更喜欢的那张。

这份数据会被审核,生成 NSFW 内容的用户会被剔除,可里面还是混着大量 NSFW 提示词。一篇 2024 年研究奖励模型的论文发现,拿 PickScore 去微调模型,哪怕提示词和性一点关系都没有,模型画出的 NSFW 图也会变多。

于是出现一个画面:前台的内容审核在拦截,但后台的打分员在往回拉扯。厂商的官方演示从不会出现 NSFW 美女,生成政策也非常严格。但众所周知,今天的大模型并不是完全可控的。它被用户的口味训练过,而用户的口味已经在惯性上走了很远。

20 世纪 30 年代,荷兰动物行为学家 Niko Tinbergen 观察到了一种海鸥。这种鸟产的是小小的、带灰斑的淡蓝色蛋。但当他在巢边放上巨大的、亮蓝色的、带黑色圆点的石膏假蛋时,鸟会放弃自己的蛋,爬上石膏蛋去孵。他把这类比真东西更有吸引力的夸张仿制品,称为“超常刺激”。

Niko Tinbergen 在户外考察中绘制鸡蛋|academia

人脸也有超常刺激,而且它把“平均就是最美”往前推进了一步。1994 年,大卫·佩雷特(David Perrett)等人在《自然》上发表研究:把一组最好看的脸合成出来,比所有人的平均脸更讨人喜欢;再把它和平均脸之间的差别放大 50%,得分还会更高。日本受试者和白人受试者,选择的方向一致。

在主流 AI 公司里,至少有一家已经把这种心理直接变成了产品功能。Grok 的图像生成有四个模式,其中一个叫 Spicy,开启后内容过滤会放松,允许生成暗示性内容和局部裸露,只对付费用户开放。

2026 年 1 月,用户发现可以上传任何人的照片让 Grok“数字脱衣”,受害者里包括儿童,多国政府介入施压。X 的应对是把图像生成整体限制为付费功能。

英国首相发言人的评价是:这只不过是把一个生成违法图像的功能,变成了付费服务。

AI 长成的,是最常按下“喜欢”的那群人的形状。1973 年,这群人是一个以男性为主的实验室。今天,他们是最常点击、最常转发、最常保存的那部分用户。人对美的偏好确实有生物基础,两三个月大的婴儿就会更久地注视被成年人评为有吸引力的面孔。

互联网第一夫人 Lena 是一种偶然。今天的默认值,则是模型从数据的中心长出来的。用户的点击把它越推越远,最后有人给它标上了价格。

AI 生成模型的统计特性、人类对“平均脸”的审美偏好,以及用户点击与商业激励构成了反馈循环。它们各自独立,但它们恰好共同指向同一个方向,成为了我们今天内容消费的默认选项。

Read the original →

How we got here

  1. Hinton-led paper examines whether automated AI R&D could trigger an intelligence explosion量子位(原生 RSS) · OpenAI
  2. Apple to Tighten macOS Full Disk Access Amid AI Agent Risks虎嗅 AI · OpenAI
  3. Andreessen Horowitz Launches a Project-Based School for High-School Graduates创业邦 科技 · Google
  4. QbitAI reports OpenAI’s 28-day reset commitment量子位(原生 RSS) · OpenAI
  5. Google drops free access to Gemini Flash and Pro on October 9极客公园 · Google
  6. OpenAI’s Safety Dispute Highlights the Need for AI Governance虎嗅 AI · OpenAI

Comments

I've used this: share my experience What I think: share my view
How important is this story?No ratings yet

No comments yet. Start the conversation.