创意编码

代码模型正在进入创作现场:它生成的不是素材,而是可修改的系统

我们习惯把创意 AI 分成两类:图像和视频交给 diffusion model,代码交给 LLM。但当程序化艺术、视频编辑和 3D 游戏越来越多地由 coding agent 完成,这条边界正在松动。

Thariq 的完整观点

Anthropic Claude Code 团队的 Thariq 观察了近期一批程序化生成艺术、视频编辑和 3D 游戏 demo。他因此更新了自己的判断:LLM coding model 可能已经比 diffusion model 更擅长相当一部分创意工作。

这句话并不是说代码模型生成的每一帧都比图像模型漂亮,而是在比较两种创作方式。Diffusion model 更像直接给出一份视觉结果;代码模型可以生成场景、时间线、摄像机、交互逻辑和资产关系。创作者得到的不只是成品,也是一套可以继续修改、运行和组合的系统。

查看 Thariq 的原始动态

Matrix 的判断

创意工作的分水岭正在从“谁能生成更好看的第一张图”,变成“谁更容易被持续指导”。

一个视觉结果如果只能重抽,修改成本仍然很高。一个由代码描述的结果,即使第一版粗糙,也可以明确地要求:镜头晚两秒移动、角色沿另一条路径行走、灯光在第 40 帧切换、所有物体遵守同一套物理规则。代码把审美要求变成了可定位、可复现的控制点。

所以,代码模型进入创作现场,不是工程工具入侵艺术,而是创作开始需要一种新的中间材料:可执行的表达。

当然,这不意味着 diffusion model 会被替代。更可能的产品形态是两者合流:代码模型负责结构、状态和修改,生成模型负责纹理、角色与高质量资产。真正值得关注的是谁掌握了创作过程中的“可控性”。

怎么验证这个判断

不要只比较一张最终效果图。拿同一个 30 秒创意任务,分别用纯生成视频和 coding agent 完成,记录四件事:达到可用质量需要多久、人工纠错多少次、局部修改是否会破坏其他部分、第二次复用能否保留结构。

如果代码模型的优势成立,它未必第一稿更惊艳,但应该在第三次修改以后明显更省力。那时我们验证的不是模型会不会创作,而是它有没有成为一种真正可工作的创作介质。

正在收听 · 脉息播客
—
0:00
0:00