四模型各100美元造PDF编辑器,几乎全有bug
AI 总结
研究者 nielstron 给 Gemini 3.8 Flash、GPT Astra 6、Opus 5 和 Fable 5 四个前沿模型各 100 美元预算(共约 400 美元),让它们自主开发一款「用户体验极好」的开源 PDF 编辑器。据开源中国的报道,结果是几乎每一个成品点几下就能找出 bug。作者据此提出,coding agent 无法像人一样与软件交互,这正是它们暴露缺陷的重要原因。
为什么重要:这类小规模对照实验提示,编码智能体的短板可能更多出在与软件的交互和验证环节,而不只是写代码本身。
一个研究 LLM for Code 的研究者,拿 400 美元做了个实验:给 Gemini 3.8 Flash、GPT Astra 6、Opus 5、Fable 5 四个前沿模型各 $100 预算,让它们自主开发一款「用户体验极好」的开源 PDF 编辑器——结果是「点几下就能在几乎每个里找到 bug」。作者 nielstron 据此提出:coding agent 不能像人一样和软件交互,所以它们...
这里只有来源提供的摘要,全文请到原站阅读。
阅读原始来源 →前因后果
- 中际旭创的三重困局:AI光模块供应链承压虎嗅 AI · Google
- OpenAI亚太公共政策主管任职六个月将离职36氪快讯 · OpenAI
- GPT-6 智能界面实测:可交互书单与小游戏36氪 人工智能 · OpenAI
- 特朗普宣布组建“AI部队”并设AI沙皇虎嗅 AI · Anthropic
- 陶哲轩批评OpenAI批量发布数学证明AIbase AI新闻 · OpenAI
- OpenAI亚太政策负责人任职半年后离职Bloomberg Technology · OpenAI