模型对比 · 仅在受控 Unreal 测试后升级

Gemini 3.6 Flash 对比 3.5 Flash 用于虚幻引擎——全球首个在线原生虚幻工作流

谷歌报告 3.6 Flash 在编码、多模态质量、计算机使用和 Token 效率上更好,并且列出的 Token 价格更低。这使得迁移值得测试,但并不代表所有 Unreal 工作负载都改善。

直接回答

在现有可用性和条款符合项目要求时,建议在新的 Unreal 评估中优先使用 3.6 Flash。对于现有 3.5 Flash 工作流,请在两个模型上复测同一批已保存的提示词、源码切片、截图、日志、工具与验收检查项。仅在测量到编辑准确性、回归、延迟、总 Token 消耗、成本、安全性和回滚能力后再迁移。

支持Unreal Engine规划的Gemini模型评估工作流编辑概念艺术
独立的编辑概念。它不是Gemini输出、Unreal Editor采集、原生集成或打包游戏结果。

这对Unreal团队意味着什么

已发布的效率信号

谷歌报告在人工分析指数中,3.6 Flash 的输出 Token 减少 17%,且在多步流程中推理步骤和工具调用更少。请在你自己的智能体循环中测量完整任务成本。

已发布的编码信号

发布报告显示 3.6 Flash 的 DeepSWE 为 49%,而 3.5 Flash 为 37%。Unreal C++、Blueprint 规划、构建诊断和插件版本工作需要各自的任务集。

已发布的计算机使用信号

OSWorld-Verified 报告为 83.0%,高于 78.4%,并且计算机使用可作为客户端工具提供。编辑器控制会引入权限和危险操作风险,因此需要独立沙箱。

迁移决策

更好的通用基准并不构成在没有提示词回归、输出 Schema 校验、速率与配额复核、安全测试和回退机制的情况下替换稳定生产路线的理由。

谷歌称发生了哪些变化

Google 将 3.6 Flash 定位为在编码、知识工作、多模态任务、token 效率和代理式执行方面,相较 3.5 Flash 的直接下一步。7 月 21 日发布说明 3.6 Flash 的价格为每百万输入 token 1.50 美元、每百万输出 token 7.50 美元,并表示该价格低于 3.5 Flash。定价、可用性、配额以及预览或稳定标签可能会变化,因此请记录测试当日的模型 ID 和定价页面。

该版本还报告了更少的非预期代码编辑和更低的执行循环次数,以及在 DeepSWE、MLE Bench、OSWorld-Verified 和 GDPval-AA v2 上的改进。这些结果可作为 Unreal 仓库任务、日志分析、截图复核与工具辅助规划的有用假设,但不能证明 Unreal API 正确性、Blueprint 编译、编辑器稳定性或打包性能。

Unreal 迁移复测套件

  • 十道闭卷问题,围绕项目特定架构且已知正确答案来源。
  • 五个带干净编译器和自动化基线的 C++ 修复
  • 使用相同截图、导出文本和预期状态转换的五项 Blueprint 规划任务。
  • 五个经过验证根因的崩溃、烘焙、打包、渲染或网络日志排查任务。
  • 使用前后对比截图和已知缺陷的三次多模态回归评审。
  • 两个具有权限限制、检查点、取消和干净回滚功能的长期运行代理任务。

决策表

Criterion3.6 Flash 测试预期迁移门槛
编码编辑更少的不必要编辑和循环是厂商报告的方向提高采纳差异率且无回归上升
Multimodal review更强的视觉与文档分析是厂商报告的方向更好的缺陷召回,无需做不支持的断言
Token 效率谷歌报告该指数中输出 Token 减少 17%降低完整任务的总 token 与成本
计算机使用内置客户端工具已可用沙箱权限、确认、日志和回滚通过
生产路由使用准确的模型 ID 与当前可用性回退、架构兼容性、配额、延迟和策略检查通过

官方证据与能力边界

Google 于 2026 年 7 月 21 日的发布是模型定位、公开基准、定价及可用性的信息来源。Google 在该页面中未声称具备原生 Unreal 集成。Epic 文档和目标项目仍是引擎行为的最终权威。

Google发布

发布日期、定位、报告效率、基准对比、定价和起始可用性。

打开官方公告

Gemini模型文档

在使用前核对准确的模型ID、支持的输入、当前状态、限制、API行为、区域和条款。

打开模型文档

Google DeepMind模型卡片

审查评估范围、安全信息、已知限制以及支撑一般能力主张的证据。

打开模型卡片

继续浏览 Gemini 3.6 Unreal 集群

Gemini 3.6 Flash × Unreal

在Unreal Engine规划、C++、Blueprint、多模态审查、成本、测试和安全交接中评估Gemini 3.6 Flash,不宣称有原生UE集成。

阅读本指南

Gemini 3.6 Flash C++ / 蓝图

在边界内使用 Gemini 3.6 Flash 进行 Unreal C++ 和 Blueprint 的规划、评审、测试、恢复与交接,同时保持编译和运行时验证在原生环境中进行。

阅读本指南

Gemini 3.6 多模态调试

为Unreal的截图、日志、追踪、Blueprint证据、渲染缺陷和可复现的原生验证构建安全的Gemini 3.6 Flash工作流。

阅读本指南

FAQ

Gemini 3.6 Flash 在 Unreal 上是否始终优于 3.5 Flash?

不一定。谷歌报告更强的通用编码、多模态、知识工作、计算机使用和效率结果,但 Unreal 工作流受引擎版本、项目架构、提示词设计、工具权限、上下文选择、输出 Schema、延迟和复核流程影响。更换生产路由前应先复测固定的项目专项套件。

现有集成应立即切换模型 ID 吗?

不一定。先确认模型当前可用性和条款,再用保存好的回归输入对两个模型 ID 进行测试。比较采纳编辑、Schema 差异、拒绝、幻觉、延迟、Token 消耗、成本、工具调用、取消率和回退能力。逐步上线并结合监控与快速回退到先前模型的通道。

已发布的基准能证明 Unreal 编码质量吗?

不会。DeepSWE 与 OSWorld 提供有价值的一般性信号,但它们并未测试你的 Unreal 版本、C++ 约定、Blueprint 资产、插件、打包目标、网络权限模型、性能预算或项目特定 API。应将其视为测试触发依据,而非项目验收证据。

在对比中可以使用 SEELE AI 吗?

可以,但应作为独立原型交接。使用相同的游戏需求生成可在浏览器中运行的方向版本,再比较每个模型是否产生更清晰的原生 Unreal 实现与测试计划。不要将浏览器输出视为两款 Gemini 模型已在 Unreal 项目中编译或执行的证据。

将研究转化为可玩的方向

返回Unreal着陆页,选择一个已验证的Workspace卡片,并在规划原生实现前使场景或玩法循环具体化。