
知名技术博主 Simon Willison 在实测中仅用一句话需求,让运行在 Codex 环境下的 GPT-6 Astra 在 2 分 39 秒内自动写出 Python 脚本并调用本地 Blender 渲染出一只骑自行车的白鹈鹕三维场景。表面上看这只是 AI 自动生成 Python 代码的小实验,本质上是编码智能体将三维图形软件降维成纯文字驱动的执行引擎,彻底打通了自然语言与可商用三维资产之间的管线。
从三维概念图构思到生成工程源文件,创作者不再需要逐个节点拉材质或手动调整摄像机。借助前沿大模型的空间理解与代码生成能力,任何能操作终端的编码智能体都可以直接在本地操作系统上接管 Blender 的 headless(无图形界面后台运行)环境,完成从程序化建模、打光、材质赋予到多帧渲染的全套操作。
┌────────────────────────────────────────┐
│ 自然语言提示词 │
│ "用 Blender 渲染骑自行车的鹈鹕场景" │
└───────────────────┬────────────────────┘
│
▼
┌────────────────────────────────────────┐
│ 编码智能体 (Coding Agent) │
│ GPT-6 Astra / Claude Code / Codex │
│ • 空间关系解构 • Python bpy 脚本编写 │
└───────────────────┬────────────────────┘
│
▼
┌────────────────────────────────────────┐
│ Blender 无界面模式 (--background) │
│ /Applications/Blender.app/.../Blender│
└─────────┬────────────────────┬─────────┘
│ │
▼ ▼
┌──────────────────┐ ┌───────────────────┐
│ 最终渲染图 / 视频 │ │ .blend 工程文件 │
│ PNG / MP4 (可商用)│ │ (可供人工二次精修) │
└──────────────────┘ └───────────────────┘
本地无界面调用的底层机制与极简启动法
这套工作流的底层逻辑并不复杂。Blender 自身内置了完整的 Python API(通常称为 bpy),允许开发者用纯脚本控制场景中的每一个网格顶点、灯光强度和渲染器参数。当编码智能体接管终端权限后,它只需生成对应的 Python 脚本,再通过命令行触发 Blender 的后台静默执行模式即可。
在 macOS 环境下,用户只需先去官网下载并安装常规的 Blender 桌面客户端。在提示词中,最省事的基础指令只需要指明路径与目标:
"Use the already installed /Applications/Blender to render a scene of a pelican riding a bicycle."(用已安装的 Blender 渲染一个骑自行车的鹈鹕场景。)
为了避免智能体在初次尝试时去自己摸索软件的命令行传参规则,创作者可以直接给出显式调用的标准模板。这样能省去模型自我试错的数次终端交互轮次,大幅压缩等待时间:
"Use Blender like this: /Applications/Blender.app/Contents/MacOS/Blender --background --python scene.py"
这里的 --background 参数意味着 Blender 不会弹出任何图形窗口,纯粹在后台分配 CPU/GPU 算力进行几何计算与着色;--python 参数则指示它直接执行智能体当场编写的代码文件。模型不仅会把最终渲染图(PNG/JPEG)保存在工作目录,还会同步保存一份 .blend 二进制工程文件。这意味着创作者如果对某处光影或模型比例不满意,可以直接双击该文件进入图形界面手动修改,完美衔接 AI 生成与人工精修。
实测三轮迭代耗时与成本拆解
在 Simon Willison 披露的公开记录中,测试环境为 ChatGPT macOS 客户端内的 Codex 模式,模型选用了 GPT-6 Astra (Medium)。整个过程经历了从基础造型到海滨日落精细化场景的三轮演进。
第一轮是纯粹的极简概念。智能体接收到基础提示词后,历时 2 分 39 秒完成了代码编写、材质赋予与静默渲染,产出了名为 pelican-bicycle.blend 与 pelican_scene.py 的产物。画面呈现出一只戴着珊瑚色围巾的几何风白鹈鹕,骑在一辆青色自行车上,配有柔和打光与低饱和纯色背景。
第二轮为了增加视觉丰富度,Simon 追加了提示词:"OK add a background and a lot of flair"(加个背景和大量装饰)。智能体耗时 3 分 51 秒对代码进行重构,扩展了近百行几何生成逻辑。画面新增了粉色木板路、波西米亚遮阳帽、悬浮气球、彩色风车、条纹海滩小屋、粉白遮阳伞、棕榈树以及青绿色的天空与三角旗。
第三轮追求最终质感,提示词仅为简短的:"OK make it a whole lot better"(把它变得更好)。这次耗时 5 分 59 秒,智能体将整个构图重构为海边码头日落氛围。鹈鹕换上了奶油色船夫帽,前车把装上了插满粉白花朵的柳条编织篮,背景点缀了蜜桃色低角度夕阳与远景帆船,三维材质呈现出温润的柔和玩具质感。
关于运行成本,Simon 使用的是 Codex 订阅制套餐(费用包含在订阅费中)。若按照公开发布的 API Token 计费标准换算,根据第三方监控工具 AgentsView 的统计测算,生成这组由浅入深的完整工程(包含多轮调试、上下文回传与脚本重写),消耗的等价 API 成本约为 4.24 美元。
从单次生成到工程化固化:Skill 技能模块与动画拓展
当智能体成功跑通一次渲染后,最关键的动作是把这次成功经验"固化"为可永久调用的技能。在 Codex 环境中,用户可以直接下达指令:
"Create a quick skill that describes how to use the currently installed /Applications/Blender based on what you learned."(根据你刚才学到的经验,创建一个快速技能,描述如何使用当前安装的 Blender。)
智能体随后会自动提炼出操作系统的路径规则、CLI 参数搭配、网格清除脚本规范以及报错排查技巧,并将其写入名为 SKILL.md 的 Markdown 文件中。一旦技能安装完成,后续的三维创作就变成了极简的指派。例如直接贴一张实物照片,并输入:
"Use your Blender Local skill to build this scene (attached image)."(调用你的本地 Blender 技能,参照所附图片搭建这个场景。)
┌─────────────────────────────────────────┐
│ 提示词: "Create a quick skill..." │
└────────────────────┬────────────────────┘
│
▼
┌─────────────────────────────────────────┐
│ 智能体沉淀经验生成 SKILL.md │
│ • Blender 路径规范 • CLI 参数配置 │
│ • bpy 网格清理逻辑 • 报错自我修复机制 │
└────────────────────┬────────────────────┘
│
▼
┌─────────────────────────────────────────┐
│ 日常即开即用的工作流 │
│ "调用 Blender 技能,按参考图搭建场景" │
└─────────────────────────────────────────┘
除了静态单帧图像,这套模式还具备直接产出三维动画的能力。创作者只要要求智能体在 Python 脚本中为物体设置关键帧动画(Keyframe Animation),命令 Blender 批量渲染出带序号的图片序列(Image Sequence),再让智能体调用系统安装的 ffmpeg 命令行工具将序列帧压制为 MP4 视频。全程不需要人工打开任何视频剪辑软件。
| 阶段 | 核心问题 | 留下的硬伤 |
|---|---|---|
| 几何形体生成 | 智能体仅能通过 Python 代码组合球体、圆柱、贝塞尔曲线等基础拓扑图元 | 复杂有机生物体(如人脸肌肉、写实毛发)缺乏高模拓扑,目前主要呈现为抽象几何或低多边形(Low-Poly)玩具风格 |
| 材质与打光 | bpy 节点树编写容易出现着色器属性拼写错误或色彩空间映射偏差 | 依赖内置 Principled BSDF 着色器的通用参数,高阶程序化着色纹理复杂,AI 单次编写易报错 |
| 渲染排错与耗时 | 纯后台渲染(Headless)遇到死循环运算或几何穿模时模型无法实时感知 | 智能体必须等待渲染完毕回读图片后才能发现视觉构图问题,修正一个细小位移往往需要重跑数分钟 |
综合判断与技术误读澄清
综合当前实测来看,编码智能体驱动三维软件的本质不是像通用文生图模型(如 Midjourney)那样直接生成像素矩阵,而是大模型充当了"资深 Python 自动化工程师",在本地环境编写控制外部工业软件的确定性脚本。
这里需要澄清两个常见的行业误读:
第一,认为 AI 已经能取代三维建模师的精细雕刻。事实恰恰相反,纯代码生成的几何体在复杂度上有其天然上限,无法替代 ZBrush 等工具的手工雕刻细节。它的核心价值在于快速产出带有三维空间坐标、完整材质管线和光源信息的"工程级原型图"。
第二,认为调用大模型操作三维软件必定极度昂贵。在本地部署桌面端 Blender 时,实际的几何计算、光线追踪和图形渲染消耗的全是创作者本地计算机的 GPU 算力,大模型只在输出几十行 Python 代码时产生 Token 费用。这使得单次概念尝试的边际成本极低。
未解决的问题:视觉闭环反馈延迟
目前该工作流面临的最大技术瓶颈是缺乏轻量化的视觉反馈闭环(Visual Feedback Loop)。智能体在 headless 模式下调整灯光角度或镜头焦距时,处于"盲写"状态。它必须等待几十秒乃至数分钟让本地显卡渲染出完整成图,再将高分辨率图片转为多模态 Token 进行视线回读。这种滞后的反馈机制导致简单的构图微调(例如将鹈鹕的帽子旋转 15 度)也需要经历一次完整的全量渲染周期,在处理复杂动画或大型场景时的时间成本依然偏高。
引用来源
- Simon Willison. "Using Blender with coding agents on macOS". 2026-09-05. https://til.simonwillison.net/llms/blender-coding-agents
- Simon Willison. "gpt-6-astra-blender-pelican-bicycle (GitHub Repository)". 2026-09-05. https://github.com/simonw/gpt-6-astra-blender-pelican-bicycle
- Blender Foundation. "Blender Python API Official Reference Manual". 2026-08-28. https://docs.blender.org/api/current/
- OpenAI. "Codex CLI & Agent Skill Integrations Documentation". 2026-08-20. https://platform.openai.com/docs/guides/codex-skills
- Kenn-io. "AgentsView: Real-time cost & token analytics for coding agents". 2026-08-15. https://github.com/kenn-io/agentsview