Create

Sign in to ReadmeX

Sign in to join communities, post, vote and chat.

New here?

Story

General AI Models Move Upstream in Video Creation

AI summary

An analysis describes two ways general-purpose models are entering AI video: Claude Opus 5.5 renders programmable videos through code, while GPT-6 Astra plans scenes and camera movements before handing rendering to specialist video models. It argues that ByteDance, MiniMax and Kuaishou are responding by expanding from standalone generation into end-to-end creator workflows, so specialist video models may retain an advantage in production reliability and integration.

Why it matters: The competition may shift from raw video generation quality toward control of the broader creative workflow.

AnthropicClaude Opus 5.5GPT-6 Astra

References 创业邦 科技 · 钛媒体

15
Source text创业邦 科技 · 11 min read

摄图网_372122107_模糊手机应用与短信AI生_(企业商用).jpg

编者按:本文转自AI价值官,作者星野,编者美圻,创业邦经授权转载。

过去一个月,AI视频领域最激动人心的讨论热潮,并非围绕Seedance、Minmax、可灵等专业视频模型,而是“越界”闯入的通用大模型。

Claude Opus 5.5 靠代码渲染视频,短短数日内催生出大量科普动画、创意短片和音乐MV,在X等平台涌现出多条爆款,甚至带火了一种新的创作范式:Vibe Video。

GPT-6 Astra则扮演起了“AI导演”,从分镜规划做到白模预演,通过深入 Blender、Unreal Engine、DaVinci Resolve 等专业软件,承担场景搭建、镜头预演、剪辑执行等工作,逐渐开始占据视频生成的上游。

两者走的是截然不同的两条路:一条是代码渲染的程序化创意,一条是空间规划的影视工业化。它们都没有在画质上正面硬刚,却从上游入口和细分场景切入,悄悄改写着AI视频的能力边界。

就在通用大模型从外围跨界切入、悄然改写AI视频能力边界的同时,专业视频模型的布局也在加速推进。字节、MiniMax、快手等头部玩家集体向创作上游渗透,逐步覆盖脚本拆解、分镜调度、成片剪辑的完整生产链路。这种对创作全流程的深度扎根,让它们在这轮跨界冲击之中,具备了更强的不可替代性。

Opus 5.5带火Vibe Video

代码直接“画”出视频?

9月22日,Anthropic 正式发布 Claude Opus 5.5。官方将发布重心放在编程能力与 Agent 任务执行上,视频能力并不是产品发布的主角。但在随后的开发者测试中,意外的爆点悄然出现:这款模型虽不直接输出像素画面,却能通过编写前端代码,生成完成度极高的动画视频。

这并非全新思路。此前 “SVG 画鹈鹕骑自行车” 一类的纯代码绘图测试早已在社区流传。但 Opus 5.5的代码稳定性与任务规划能力,让这种创作方式从玩具级演示走向了全面落地,相关作品先在X平台集中涌现,随后蔓延至小红书、抖音等国内平台。

有创作者调侃,Opus 5.5发布后的一周,自己的时间线几乎被各类AI代码视频填满。

热潮之中,最具破圈效应的标杆案例来自X平台博主 @anabology。他仅向 Opus 5.5 提供了一段参考提示词、Midjourney 调用权限与一份情绪板,模型便自主启动全流程制作,12小时后便输出了一部电影质感的反乌托邦短片。截至目前,该作品相关帖子的浏览量已突破2000万。马斯克对这条作品表现出极高关注度,先后多次转发互动,直言 “这一次我真切感受到了AGI的深远影响”。他还对一条“Opus 5.5已达到通用人工智能80%-90%水平” 的观点帖回复 “Accurate”。来自直接竞争对手的公开认可,让 Opus 5.5的视频能力进一步破圈。

科普短片、产品宣传片等场景也涌现出了大量引爆讨论的案例。博主vittorio仅给出一句创作指令,Opus 5.5 便产出一部2分16秒的西方文明史短片,全片未调用任何专业视频生成模型。视频发布两天播放量破千万。

有创作者依托Opus 5.5基于Remotion框架编写约7400行前端代码,自动完成全片画面动效与转场节奏编排,搭配开源语音与Python生成的配乐,仅一小时就产出一支三分钟的AI发展史主题视频。

推理初创公司Deedy使用Opus 5.5制作产品发布视频,单条视频生成耗时仅约 1 分钟,API 成本仅约2美元,最终收获32万播放量。Wasmer团队则直接将产品发布公告的文字内容输入Opus 5.5,模型便一次性生成了完整的品牌宣传视频,传播效果超出团队预期。

这些案例让“Vibe Video” 迅速成为一种新的创作范式:不依赖专业视频模型,仅凭大模型写代码,就能产出完整视频。GitHub上的案例集合站awesome-opus5-5-videos已收录400多条作品,覆盖动效图形、知识讲解、3D 场景、小游戏等品类,每条都附有创作者公开的原始提示词与代码,相当于把成熟的创作方法论直接开源。国内创作者也纷纷入场,用它制作产品宣传片、科普动画和数据可视化视频。

Opus 5.5 的视频生成逻辑,与传统视频生成模型有着本质区别。

传统模型基于海量训练素材一次性生成完整画面,Claude走的是纯代码渲染路线,像专业动效设计师一样逐帧搭建画面——通过编写 SVG、Canvas、Three.js、Remotion等前端代码定义所有视觉元素与运动轨迹,再在无头浏览器中运行并逐帧录制,最终经 FFmpeg编码合成MP4文件,过程中还会自动校验帧画面并修正偏差。

整个流程里,大模型一人分饰四角:担任导演敲定分镜节奏与视觉风格,担任制片拆解任务、调度多段代码并行生成,担任画师以代码逐帧绘制画面元素,担任剪辑完成音画同步与成片输出。

这条路线最大的优势,是极强的可编辑性与极低的迭代成本。传统视频模型一旦结果不满意,往往只能修改提示词、整条重生成;代码生成的视频则只需改动对应镜头的几行代码,参数、运动、风格均可精确控制,画面元素还能分层拆解。

但Opus 5.5的应用场景边界也十分清晰。它天然擅长程序化、图形化的内容,如文字动效、数据图表、科普动画和抽象3D场景,却很难胜任写实真人画面与复杂的自然物理效果,而后者恰是传统视频模型的核心主场。

这也决定了当前Vibe Video的渗透范围仍集中在轻量化商业内容、知识科普与创意实验赛道,尚未切入影视级写实内容的主流市场。

GPT-6 Astra抢走导演椅

视频模型将沦为“渲染工”?

如果说Opus 5.5是从代码切入创意视频,GPT-6 Astra则把手伸向了更上游的策划环节,重塑AI视频的生产逻辑。它同样不直接生成最终画面,而是扮演“导演+制片” 的角色:先完成创意规划、空间设计与镜头调度,再交给专业视频模型渲染。

GPT-6 Astra于9月3日正式发布,官方定位为新一代通用智能体模型,核心能力覆盖计算机操作、编程、科学研究等领域,其中对 Blender、Unreal Engine 等三维创作软件的操作能力,成为它切入视频创作的关键支点。

Higgsfield AI公开的一项测试颇具代表性。任务是制作一段连续穿越多个空间的一镜到底动画,Astra没有直接出图,而是先在Blender里用简单几何体搭起白模场景,规划人物走位和整条运镜路线,待空间逻辑与机位运动确认无误,才交给Seedance 2.5渲染成片。

最终成片里,镜头从一个空间穿入下一个空间,人物位置与场景关系始终保持一致,在相当程度上缓解了AI视频长期存在的空间错乱和镜头穿模问题。

Astra的全流程创作能力同样引人注目。海外创作者Nate Herk做过一个实验:只给一句开放式指令,让Astra制作一条关于自身发布的YouTube视频。Astra 自主完成资料调研与脚本撰写,调用工具生成克隆声音旁白,驱动AI数字人出镜,并完成素材剪辑与音乐音效搭配,最终交出可直接发布的成片。

专业剪辑软件的接入,进一步放大了这种能力。9月8日,DaVinci Resolve 21.1上线原生MCP服务器,支持AI助手通过协议直接操作软件。一位拥有20 年经验的剪辑师把75分钟的原始素材交给Astra,它直接操作剪辑软件,输出了包含96个剪辑片段、字幕、调色与音量校准的22分钟粗剪版本,全程无需人工干预。

国内创作者也很快摸索出本土化的工作流。有人把完整的仙侠剧本交给Astra拆解分镜、设计镜头,再对接Seedance 2.5生成90秒成片,阵法设计与镜头切换的完成度超出预期;另有创作者总结出一套相对成熟的产品宣传片流程:先由 GPT-6做白模预演,验证镜头可行性,再导出预演视频交给视频模型渲染,最后用剪辑工具合成。整套流程约两小时,成本折合人民币仅150元。

支撑这些表现的,是GPT-6 Astra的世界模型与3D空间理解能力。它能理解多个相连空间的拓扑关系、人物走位的内在逻辑以及摄像机的运动路径,而不只是生成一张张平面画面。

更大的价值在于,创意因此变成了可修改、可复用的资产:空间布局、人物调度与摄像机路线都能留存下来,更换人物、场景、画风甚至故事时,不必从零开始。

至此,通用大模型已走出两条差异化路线,与专业视频模型构成交错竞争的格局。以 Opus 5.5为代表的代码派,长于程序化创意与动效科普,成本低、迭代快,适合轻量化商业内容。

以 GPT-6 Astra为代表的规划派,长于复杂镜头调度与空间叙事,搭配视频模型可产出影视级内容,更接近专业制作流程。二者并非替代关系,完全可以协同:GPT-6 负责分镜规划,视频模型负责写实部分的渲染,拼成一条互补的工作流。

视频模型集体跑向上游

全链路布局加固护城河

两条跨界路径,正在悄悄重构AI视频行业的利益分配。

一方面,产品宣传片、知识科普、数据可视化等商业与创意内容,开始Claude低成本的代码路线分流。另一方面,GPT开始掌握视频生成分工,将Seedance等视频模型降格下游的渲染工序,长期或将压低其在产业链上的价值。

就在通用大模型从外围搅动赛道之际,Seedance、可灵、MiniMax等专业视频模型厂商也在按自己的节奏加固护城河。各家方向高度一致:向上游创作环节延伸,深度嵌入创作者的完整工作流,用端到端的生产能力取代单点的素材生成能力。

9月20日,剪映在“AI新创作发布会” 上推出一站式创作工作台“剪映Hub” 和智能创作 Agent “剪映助手”。结合此前推出的小云雀Agent、内测的“漫剧创作工具”,字节已搭起“底层模型+垂直场景Agent+通用创作工作台” 的完整生态,用户从产生想法到导出成片,可在字节体系内一站完成。

其他头部玩家也在加速跟进。7月31日,MiniMax发布新一代多模态视频模型 H3。不到三周后的8月20日,便上线创作Agent工作台MiniMax Design,由主 Agent 拆解需求,调度多智能体并行完成从脚本到成片的全流程。

快手则在9月底亮出双轨布局。一边,可灵AI 4.0官宣10月上线,补齐30秒原生时长、4K HDR、多模态参考等关键参数短板,继续夯实模型层的竞争力;另一边,创作Agent工具ikli的内测消息同步流出,主打从需求理解、脚本编写到镜头生成、配音剪辑的全流程制作。

从结果看,这一轮全链路升级让专业视频模型的护城河更深了。大模型的长处在于创意发散、代码生成与流程调度,但在核心商业创作场景中,创作者要的不止是把想法落地,还有稳定的画质、标准化的成片质感、可复用的素材资产,以及与既有工作流的无缝衔接,而这些正是专业厂商深耕的领域。

叠加全链路Agent的加持,专业视频模型在短剧、漫剧、品牌广告等核心赛道上,短期内仍有难以替代的价值。

换言之,大模型带来的是新的技术路径与创作思路,拓宽了AI视频的边界,却尚未撼动专业视频模型的基本盘。

恰恰因为看清了上游入口的分量,字节、快手等才加快了全链路布局的步伐:只有深度嵌入创作者的完整工作流,覆盖从创意到交付的每一个环节,才能真正守住用户入口,不被架空为单纯的算力供应商。

通用大模型与专业视频模型的边界正在模糊,未来的胜负手,不在于谁的参数更高,而在于谁能更深地融入真实的创作生产流程,成为创作者离不开的生产工具。

本文为专栏作者授权创业邦发表,版权归原作者所有。文章系作者个人观点,不代表创业邦立场,转载请联系原作者。如有任何疑问,请联系[email protected]。

Read the original →

How we got here

  1. Claude reportedly adds Chinese UI while mainland China remains unsupported创业邦 科技 · Anthropic
  2. Kling AI Reportedly Prepares Hong Kong IPO, Testing Kuaishou’s Valuation36氪 人工智能 · Kling AI
  3. OpenAI and Anthropic face a holiday of agents, pricing and scrutiny虎嗅 AI · OpenAI
  4. Report: Claude-generated Lean proof targets a percolation conjecture36氪 人工智能 · Anthropic
  5. Why ChatGPT titles sometimes contain spam fragments36氪 人工智能 · OpenAI
  6. AI Animated Dramas Lower Production Costs, Not the Competition虎嗅 AI · ByteDance

Comments

I've used this: share my experience What I think: share my view
How important is this story?No ratings yet

No comments yet. Start the conversation.