Fixture控制
固定修订版本、Unreal版本、插件、资产、平台、构建模式、提示词与工具。
Qwen3.8 × Unreal评测实验室
一个有效的基准会固定修订、任务、证据、预算、评分器和恢复路径。它测量的是变更是否生效,而不是回答听起来是否“高级”。
目前尚未建立官方公开的Qwen3.8 Unreal基准。请建立一套本地套件,在统一条件下评估完成度、首次通过率、虚假API率、回归、证据质量、人审耗时和打包行为。

快照日期:2026年7月20日。执行前请重新核实与时间相关的预览、可用性、路线图、定价和开源权重声明。
固定修订版本、Unreal版本、插件、资产、平台、构建模式、提示词与工具。
对编译、运行时、自动化、打包、正确性、延迟、成本、复审和恢复进行评分。
实际可行时隐藏模型身份,并对模型与人工尝试使用统一评分标准。
保留首次失败、被驳回的差异、日志和回滚结果;静默重试会扭曲可靠性。
选择一个编译修复、Blueprint评审、运行时bug、资源/配置问题及打包构建检查。
记录预期负责人、验收路径、禁止变更和最小证明要求。
使用相同的上下文、工具、时间、Credits上限和停止规则。
套用评分规则、盲审、重复不稳定任务,并公开限制条件。
修复一个可确定重现的编译失败。解释第一个错误,提出最小差异,并在证据不足时停止。
诊断客户端/服务器不一致,并给出权威边界及一个可复现的修正测试。
回顾前后抓取、玩法步骤和日志;返回失败矩阵与回滚触发条件。
将缺失资源与模块/配置错误分离,并一次只提出一个诊断性修改。
任务ID、修订号、输入、工具、预算、权重与排除项。
提示词、回复、差异、命令、耗时、成本、失败与备注。
完成度、编译、运行时、打包、虚构、回归、审阅耗时与可复现性。
可批准用途、禁止用途、监控、复测日期和回滚负责人。
SEELE AI可以生成原生虚幻5游戏,在浏览器中预览,优化并打包,并提供可下载的游戏或打包构建,用于外部发布或付费的Seele游戏。不保证销售。
所引用的发布来源未提供公开的Unreal专用基准。
通过构建、运行时和打包证据验证任务正确性。
先从五个具代表性的失败开始,再扩展到主要系统和回归场景。
仅提供相关且获授权的上下文,并单独衡量检索性能。
不行。重复任务,保留失败,测试恢复能力,并量化审核者工作量。
它可以提供一个浏览器原型目标,而原生评分仍在 Unreal 中进行。
在SEELE AI中生成原生虚幻引擎5游戏,审查浏览器预览,然后优化、打包、下载或发布游戏。将许可、目标平台测试和第三方模型声明作为单独的验证关卡。
符合条件的 SEELE AI 输出可选付费下载。可用性、需求、定价和收益不作保证。