最近,一段“Gemini 4 Pro 用一句提示词生成 Three.js 机械蝴蝶”的视频在 X 上传播。画面足够惊艳,也很容易让人得出一个结论:Gemini 4 Pro 已经发布,而且 3D 编程能力超过了其他模型。
但截至 2026 年 9 月 22 日,能确认的事实只有两层:
- 社区用户发布了一段由其标记为 Gemini 4 Pro 的 Three.js 机械蝴蝶演示;
- Google 已确认正在训练 Gemini 4,但 Gemini API 官方模型列表中暂时没有 Gemini 4 Pro。
因此,这段视频适合被当成“前沿模型生成交互式 3D 网页的能力样本”,不适合被当成已经验证的官方发布或严格基准测试。
先给结论:演示是真的,模型身份仍未被官方确认
原始发布者描述的任务很简单:让模型用 Three.js 创建一只漂亮的机械蝴蝶。中文转帖进一步把它与 Fable 5.2 的 Three.js 效果做了主观比较。
问题在于,帖子没有提供完整对话、模型端点、运行日志、代码仓库、重试次数和人工修改记录。原作者还提到,它此前可能在 Arena 中以 gemini-3.7-flash 占位名称接受测试,随后又被移除。这些都是发布者的观察,并非 Google 或 Arena 的正式确认。
Google 当前公开的信息是:公司已开始 Gemini 4 的预训练,并称这是其迄今最有雄心的预训练项目。官方开发者文档目前列出的可用模型仍以 Gemini 3.x 系列为主,没有 gemini-4-pro 端点。两条信息可以同时成立:Gemini 4 正在研发,但社区演示中的具体模型身份仍然未知。
| 问题 | 截至 2026-09-22 的答案 |
|---|---|
| Google 是否确认在开发 Gemini 4? | 是 |
| Gemini 4 Pro 是否已出现在官方 API 模型列表? | 否 |
| X 上是否有标记为 Gemini 4 Pro 的 Three.js 演示? | 是 |
| 能否仅凭视频证明它优于其他模型? | 不能 |
| 这个案例是否仍值得研究? | 值得,重点是任务设计和生成工作流 |
为什么“机械蝴蝶”比一张 AI 图片难得多?
Three.js 是运行在浏览器中的 3D JavaScript 库。按照 Three.js 官方手册,一个最基本的 3D 页面也要组织场景、相机、渲染器和对象;想让机械蝴蝶既好看又可交互,还要处理更多环节。
几何结构
模型需要把蝴蝶拆成身体、翅膀、连杆、齿轮和装饰零件,并保持左右对称。只要层级或坐标系处理错误,动画就会散架。
材质与灯光
金属、玻璃、发光纹理和线框需要不同材质。灯光、环境反射和后期效果决定它看起来像“机械艺术品”,还是一组灰色几何体。
动画系统
翅膀扇动不是简单地上下旋转。机械感来自多个关节之间的节奏、限制和联动,动画循环还要避免穿模和突跳。
交互与界面
拖拽旋转、缩放、暂停、爆炸视图和参数面板都需要事件处理与状态管理。一个“看起来能动”的录屏,不等于完整代码在不同浏览器和设备上都稳定。
工程质量
生成代码还要解决资源加载、窗口缩放、内存释放、移动端触控、帧率和错误处理。这些细节不会在 20 多秒的演示里自动出现,却决定项目能否交付。
所以,真正有价值的能力不是“模型画出一只蝴蝶”,而是它是否能把视觉设计、3D 数学、代码结构和交互体验同时组织起来。
可直接复用的 Three.js 机械蝴蝶提示词
原帖只透露了一个非常简短的任务描述。为了提高复现成功率,可以把需求改写成下面这个工程化提示词。它不是原帖逐字提示词,而是一份适合实际开发的模板。
请创建一个可本地运行的 Three.js 单页项目,主题是一只精密机械蝴蝶。
视觉要求:
- 蝴蝶由金属骨架、半透明发光翅面、齿轮和连杆组成;
- 整体左右对称,深色背景,冷色主光和暖色轮廓光;
- 材质层级清晰,不使用需要授权的外部模型或贴图。
交互要求:
- 鼠标拖拽或触摸可环绕观察,滚轮可缩放;
- 提供“飞行 / 停止”“普通 / 爆炸视图”“重置相机”按钮;
- 爆炸视图要保留零件与原位置之间的可理解关系;
- 页面缩放后画布自适应,移动端可操作。
工程要求:
- 使用 Vite + Three.js,给出完整文件结构和运行命令;
- 将场景、模型、动画、交互和 UI 分成清晰模块;
- 不依赖付费服务;
- 避免控制台错误,切换页面或销毁场景时释放资源;
- 首屏显示加载状态,并在 WebGL 不可用时给出说明;
- 在 README 中说明参数、已知限制和二次开发入口。
先列出实现计划和验收标准,再生成代码。完成后检查:页面能否启动、按钮是否工作、移动端是否溢出、连续运行 3 分钟是否明显掉帧。
这个模板的重点不是“更多形容词”,而是把视觉、交互、工程和验收拆开。模型知道什么叫漂亮,却不知道你愿意接受什么样的代码质量,除非把标准写出来。
如何做一次可信的多模型对比?
如果你真的想比较 Gemini、Fable 或其他模型,不要只看最漂亮的一次录屏。一个最小可复核实验应满足:
- 使用完全相同的提示词和初始项目。
- 记录模型名称、版本、日期、推理档位和工具权限。
- 每个模型至少独立运行三次,不挑最好的一次冒充平均水平。
- 公开第一次输出、修复轮数、人工改动和最终代码。
- 在同一台设备、同一浏览器和同一网络环境中测试。
- 把主观审美和工程指标分开评分。
可以使用这张验收表:
| 维度 | 检查方法 |
|---|---|
| 一次运行成功率 | 安装依赖后能否直接启动 |
| 功能完整性 | 相机、动画、按钮和移动端交互是否工作 |
| 视觉质量 | 结构、材质、灯光、动画是否协调 |
| 代码质量 | 模块边界、命名、错误处理和资源释放 |
| 性能 | 桌面与中端手机上的帧率、内存和发热 |
| 可维护性 | 修改颜色、零件数量或动画速度是否容易 |
| 总成本 | 生成时间、修复轮数、人工编辑时间和 API 成本 |
这比“哪个视频更惊艳”更接近真实生产力。
用 AI 生成 3D 网页,最现实的变现方向
机械蝴蝶本身未必能赚钱,但它展示了一个重要变化:过去需要 3D 设计、前端开发和动效协作的轻量项目,现在可能由一个人完成第一版。
互动产品落地页
为硬件、珠宝、家具或潮玩制作可旋转、可拆解的产品展示。客户购买的不是 Three.js 代码,而是更高的理解效率和品牌记忆点。
3D 作品集和数字名片
摄影师、设计师、独立开发者可以用轻量 3D 场景替代千篇一律的模板站。收费点在创意方向、品牌适配和上线维护。
教育与科普交互
把机械结构、人体器官或科学装置做成可旋转和分层查看的网页。模型可以快速生成原型,专业人士负责事实校对。
广告活动和社交传播页
短周期营销项目需要“新鲜感”,但预算通常不足以支撑完整 3D 团队。AI 可以压缩第一版成本,人工仍要负责视觉统一、性能和兼容性。
最可行的服务不是“卖一句提示词”,而是交付一个可访问、可维护、加载快、手机能用的完整页面。
从演示到上线,还差哪些工作?
AI 生成的视觉原型要进入真实网站,至少还要补齐:
- 首屏体积和懒加载优化;
- 低性能设备降级方案;
- 键盘操作、减少动态效果和可访问性说明;
- 资源版权与第三方依赖审查;
- 埋点、错误监控和跨浏览器测试;
- 静态截图或视频后备内容,避免 WebGL 失败后页面空白;
- 与品牌字体、色彩和内容系统统一。
这恰好也是个人开发者最容易建立差异化的地方:模型把“做出来”变快,人仍要把“能交付”做好。
常见问题
Gemini 4 Pro 已经正式发布了吗?
截至 2026 年 9 月 22 日,Google 已确认正在训练 Gemini 4,但官方 Gemini API 模型列表里没有 Gemini 4 Pro。社区演示中的模型标签尚未得到官方确认。
原帖的机械蝴蝶只用了一句话吗?
原作者描述的是一个简短提示,但没有公开完整会话、重试次数、代码仓库和人工修改记录,因此不能确认完整制作过程只有一步。
不会 Three.js 也能做类似网页吗?
可以生成原型,但上线前仍需要理解基本前端结构、调试控制台错误、处理性能和部署。完全不看代码,后期很难维护。
这能证明 Gemini 4 Pro 比 Fable 更强吗?
不能。缺少相同参数、多次重复、完整代码和客观指标时,单个案例只能说明潜力,不能说明普遍性能排名。
Three.js 是 AI 模型吗?
不是。Three.js 是浏览器 3D JavaScript 库,AI 模型负责生成或修改使用它的代码。
总结
这段机械蝴蝶演示最有价值的部分,不是一个尚未证实的模型名称,而是它让“自然语言 → 可交互 3D 网页”变得足够直观。
如果你是内容创作者,可以把它当作选题;如果你是开发者,应把它变成可复核实验;如果你想靠它接单,则要把注意力从“模型做得多炫”转向“页面能否稳定上线、适配品牌并解决客户问题”。