Flash模型横评复盘:决定交付的是工作台环境
奇点研究社在36氪发文复盘一次 Flash 模型横评:同一批任务下,DeepSeek-V4.1-Flash 与云之声 U2-Flash 在 AI 办公工作台 WorkBuddy 中完成手机行业研报与三消小游戏,而 Qwen-3.8-Flash 只能在千问 AI 平台网页版对话框里作答,出现新机信息张冠李戴、数据判断错误、游戏积分逻辑卡死等问题。把 Qwen 换进同一环境 WorkBuddy 复测后,报告完成八章并主动排错,游戏也走通“定位 Bug—改代码—本地重编译验证”的闭环。文章据此提出,AI 办公竞争正从“模型入口”转向“任务入口”,并进一步走向企业级 AI 基础设施与多模型治理。
为什么重要:它提醒我们,模型横评若忽略联网、工具调用与交付闭环等环境差异,容易把“环境”的账算到模型身上。
一个模型最终能交付什么,既取决于它本身的能力,也取决于它被放进了怎样的工作环境。
Flash 模型越来越像AI世界里的“基本款”。
速度快、价格低,应付日常任务绰绰有余。模型横评也因此有了一个固定套路:给几款模型布置同样的任务,看谁的答案更好,再排个名次。
这次Flash模型测评,一开始也是按照这个既定动作执行的。
我们用DeepSeek-V4.1-Flash、云之声U2-Flash、Qwen-3.8-Flash跑了两项任务:一份手机行业深度研报,一个三消小游戏开发。U2Flash和DeepSeekFlash分别在严谨度和洞察力上表现突出,千问则在研报事实核验和游戏交付上暴露出明显短板。
可是当我们复盘整个测试流程时,突然发现这场测试从一开始就不公平:三个模型并没有在同一个工作环境里运行。
DeepSeek Flash和U2Flash是在WorkBuddy里跑完全程,可以联网检索、读写文件和调用工具;Qwen3.8 Flash 则是在千问 AI 平台的网页体验版里完成的,全程只有一个孤立的对话框。
由于初测时没能在千问办公桌面端里直接调用Qwen3.8 Flash模型,所以我们又补了一轮复测并严格控制变量,用完全相同的任务和材料,在WorkBuddy里重新跑了一遍。
结果出乎意料,初测表现拉垮的Qwen3.8 Flash,复测质量明显提升,第一轮里大量数据错误被重新核验、修正;原本卡住的三消小游戏,也完成了从定位 Bug 、修改代码到实际验证的完整闭环。
同一个模型换个工作环境,交付结果就能出现如此巨大的差异,我们不禁思考,所谓的模型评测,测的到底是什么?是模型本身,还是模型进入工作流之后能交付的实际成果?
01
千问模型在自家平台“裸奔”
这次测评的起点,源于一次失败的接入。
我们原本下载了千问办公桌面版,想直接在里面调用Qwen 3.8 Flash模型,但很快遇到了阻碍。千问办公给出的解释是,具体使用哪个模型由产品的会话配置决定,用户无法在对话中手动切换或指定底层模型,模型是否开放也取决于具体入口和账号、版本。
后来我们退而求其次,转向千问AI平台的网页体验版,找到3.8Flash入口,才开始正式跑任务。
当时看,只是换了个操作入口,事后复盘才意识到,这是整场测试最重要的隐性变量。
先看第一轮。
研报任务其实埋了不少坑。我们给到的五份材料包和八个任务清单,里面有数据张冠李戴、单位错误、时间口径混淆和无信源断言。游戏任务则要求模型把一个三消小游戏做出来。
DeepSeek Flash
U2Flash
U2Flash 对数据陷阱的处理最细,发现"OPPO 687.2 亿元"与传音控股年报数据撞车后,一路追查到工商主体和统计口径。DeepSeek Flash的长处是独立判断,能提出"芯片分叉"这种有锋芒的观点。
Qwen3.8Flash的问题,集中出现在"新机全景"一节。
Qwen3.8Flash的问题,集中出现在"新机全景"一节。材料中的真实新机尚未到齐,它便提前交了稿,用训练数据里的旧产品线去填2026 年的新机清单:vivo 被写成 X200 系列,华为则出现 Pura 80、Mate 70 等型号。华为2025年报里的营收、净利润、终端业务数据没有拿准;OPPO 的一组数据也判断错误。
游戏任务暴露的短板更严重,它仅生成了一段纯文本代码,需要手动复制到记事本或编辑器中另存运行。在浏览器中打开后,交付物依然停留在极初级的网页 Demo 阶段,能点开玩,但得分逻辑卡死不动,像一个能跑起来、但没有灵魂的空壳。
Qwen3.8flash网页版
这些表现当然有模型本身的因素,比如用旧有历史知识补齐当下信息缺口,生成后缺乏自检机制等,但首轮测试中的,Qwen3.8Flash没有拿到另外两款模型手里的“武器”。
DeepSeek Flash和U2Flash是在WorkBuddy这样的AI办公产品中运行的。查阅华为年报、IDC 出货量、工商数据时,可以联网检索;遇到材料里的数据陷阱,可以发起交叉验证;报告撰写完成后,能够直接进行本地文件落盘、分章整理并打包输出。
至此,局面陷入尴尬,我们以为自己是在横向对比三款 Flash 模型的技术能力,但实际对比的却是三套截然不同的模型调用与交付方式。
一边是模型接入了具备联网、工具调用、本地读写与自检能力的工作台;另一边是模型能力被局限在单一网页对话框里“裸奔”。交付落差,显然无法简单归咎于“模型智商不济”。
于是我们重置变量,任务不变,材料不变,模型不变,只把Qwen3.8 Flash换进相同的工作环境WorkBuddy里,重跑全程。
结果出乎意料。研报任务中,Qwen Flash几乎复现了此前U2Flash 的工程标准。开篇即输出了一份包含七处排错的凭据清单,且每一处都做了交叉验证。
Qwen Flash复测版
而且还建立了“官方、机构、第三方估算”的三级信源体系,并在文中做了逐条标注。初测里,千问在"新机全景"上出现大面积事实错误;复测后,它不仅完成了八章报告,还主动做了一轮数据排错。
在游戏开发任务中,差异更为悬殊。在网页版里,千问只能给出一个静态的文本代码;而在 WorkBuddy 环境下,当渲染出现 Bug 或积分逻辑卡死时,Qwen Flash能够通过工作台的执行环境重新读取报错日志,完成“定位错误、修改代码、本地重新编译验证”的闭环,最终交付出一个可玩性还不错的小游戏。
模型之所以表现出截然不同的交付上限,是因为它获得了重新查证、重新读取上下文材料、调用环境工具并主动纠错的条件。此前被困在对话框里的能力,在具备完整工作链路之后,被最大化释放出来。
DeepSeek Flash
U2 Flash
这也让我们重新理解了当下 AI 办公产品的路径分野。
千问办公倾向于将模型能力、应用工具与交互界面融合成一套高度标准化的交付方案。这种“开箱即用”的体验极大降低了使用门槛,却也限制了用户对底层模型的自定义选择权。为了追求前端体验的“绝对统一”,模型在复杂、动态场景下的应变潜力被无形中“封印”了。
反观 WorkBuddy,它不强行绑定单一模型生态,允许用户在同一个工作区内根据任务需求自由挂载 DeepSeek、U2或Qwen,把模型当成“可插拔的算力引擎”,把选择权彻底交还给任务本身,模型在这里更像一种可以随时更换的算力资源,工作台负责把任务、上下文、工具和模型组织起来。
在此路径下,AI 办公产品的核心价值不再取决于“我的模型有多强”,而在于“我能否将最合适的模型,精准无缝地嵌入复杂的真实工作流中”。
02
Agent竞争升维
从“模型入口”到“任务入口”
回看这场测试,三次体验对应了三种完全不同的 AI 使用方式,也映射了AI应用演进的三个阶段。
第一阶段是对话式的AI助手,单模型聊天,主要面向个人场景。用户进入厂商预设的套件中,模型、工具和交互逻辑都已被全盘打包。它的本质是提升个人效率的辅助工具,优点是简单,代价是选择权的全面让渡。
第二阶段是可调度的“Agent 工作台”,即从“聊天”走向“完成任务”,实现“多模型”按需挂载与团队协同。此时,AI 进化为具备工具调用能力的 Agent,真正开始执行工作。
模型被剥离掉“产品入口”的光环,“降维”为工作流中的一个可插拔组件。这从根本上改变了"用模型"的逻辑。
过去是“因为我想用千问,所以我打开千问”,现在是“我有一个任务,要把合适的模型调度进我的工作台,”AI应用的竞争从"模型入口"走向"任务入口"。
当然必须承认,工作台无法凭空捏造模型本身不存在的智力,模型的推理上限、事实判断与自检能力依然是硬指标。
千问在部分任务中的“交付结果不及预期”,固然有其模型本体的局限,但缺少联网检索入口、缺乏工程化交付环境的体验版平台形态,也是拖累其表现的硬伤。
模型的差距,被“环境”放大,也被“环境”抹平。当主流模型在底层参数和基础推理上日趋同质化,决定用户体验的胜负手,已从“调用哪家模型”,转向“在怎样的工程环境里调用模型”。
知识密度之外,模型的能力分层也在被工程化程度和交付闭环重新定义。一个能检索、落盘、调试、交付的“环境”,成为模型能力得以释放的大前提。
测试过程中还有个小细节颇具启发,我们通过Ulanzi与WorkBuddy联名的AI 硬件进行了交互与指令输出。硬件的接入,让原本局限在屏幕里的工作流有了一个新的物理节点:AI从网页里的对话框进入桌面工作台,又进一步延伸到了真实的硬件设备。
以往我们讨论AI,习惯问的是“模型在哪里运行”,硬件的加入让我们进一步思考“未来,用户该从哪里唤醒 AI”?
从网页文本框,到桌面级 Agent 工作台,再到软硬一体的物理节点,AI 办公的下半场,不再属于抢占“模型入口”的人,而属于掌控“任务入口”的人。
03
AI办公下半场
从任务入口到企业AI基础设施
过去我们判断一个 AI 产品好不好用,习惯看两个指标:模型聪不聪明,回答漂不漂亮。但当Agent真正介入实际业务,评价体系已经发生了根本性重塑。
它能不能找到材料?能不能正确调用工具?能不能记住上下文?遇到报错能否自主纠偏?最关键的是,最终交出来的成果,是一个能直接拿去复用的“交付物”,还是一个需要人重新收拾残局的“半成品”?
如果说个人效率工具解决的是员工如何用AI,那么当 AI 办公产品深入到企业场景时,必然要撞上下一道高墙:企业如何管理AI?
这也进入了AI应用演进的下一阶段,即全治理的AI组织,或者叫企业AI基础设施期。
用户从“使用 AI”升维至“管理AI”,实现多模型的统一调度、企业级权限隔离与协同治理。模型被进一步解耦并融入企业组织架构,充当数字员工。这一阶段的硬核诉求不再只是单纯提效,还有精细化控制算力成本与数据安全风险。
成本控制上,企业要思考Token 账单谁来支付?各部门算力额度如何分配?
权限与治理上,谁能调用特定模型?谁能接入核心数据库?AI 在本地操作文件时的安全边界在哪里……
如今这场关于“企业 AI 基础设施”的争夺战,各大巨头均已亮牌。
在刚刚结束的云栖大会上,整合后的千问办公被推至 AI 落地展示的绝对 C 位,不仅加速推进 Personal Agent 战略,更集中发布了“企业上下文”等私有数据管理能力,试图通过深度绑定钉钉生态与云端算力,把 AI 嵌进企业协同的每一个齿轮。
而百度亦在加速整合内部办公 Agent 资源,此前百度搜索、网盘、地图、秒哒和伐谋等产品能力已通过Skill接入百度搭子,7月百度搭子企业版发布后,次月又将 dodo 全面并入“百度搭子”,试图在 B 端办公生态中构筑闭环。
最近,WorkBuddy 企业版也进行了一次大升级,将腾讯文档、腾讯乐享、腾讯网盘、安全与效能运营平台、腾讯 AI 设计智能体 Ardot 等五项办公能力进行套件化整合,且打通了企业 AI 的“身份系统”,目前WorkBuddy 已经具备 SSO 单点登录、组织架构管理、成员用量控制、统一订阅等企业级能力。
从账号、组织架构、Credit 用量,再到 Skill、Agent 和企业数据,企业管理员开始可以在同一套体系里管理这些 AI 资源。WorkBuddy在把一个原本面向个人的 Agent 工作台,逐渐改造成能够承载组织级 AI 协作的基础设施。
这也让“任务入口”的概念有了新的含义。
对个人来说,任务入口意味着“我把事情交给 AI”;对企业而言,任务入口意味着“企业把一整套业务流程交给 AI”。
前者解决的是怎么让 AI 帮人完成工作,后者解决的是怎么让一群 AI 在企业里被管理、被调用、被约束,并持续产出结果。
从模型到 Agent,再到企业 AI 基础设施,不同厂商的路径虽然不同,但争夺的焦点一致:谁能把模型嵌进企业的真实业务流程。
当底层模型能力趋于稳定,围绕“执行与交付”的工程化建造,才刚刚拉开序幕。
本文来自微信公众号“奇点研究社”,作者:徐婷,编辑:奇博士,36氪经授权发布。
前因后果
- 腾讯开源 EVIE-4.5B 视觉文档检索模型腾讯混元 · Hugging Face · Tencent
- 腾讯上线Knocket:会聊天的AI个人名片36氪 人工智能 · Tencent
- Reflection发布Beam,西方开放模型重新提速36氪 人工智能 · DeepSeek
- 日媒:中国9月推出16个新模型,AI开发持续加速科技新报 · DeepSeek
- 阿里拟领投UniPat 3亿美元融资品玩 实时要闻 · Tencent
- Agency Agents 推出原生桌面安装应用GitHub Trending(每日) · Qwen