VRA 视觉实验室/构建背后

教VRA看Viking Rise。
真实的例子。更高的标准。

Viking Rise 不会将每个目标保持在同一个位置。动物移动,风景变化。 Sector Vision 探索了 VRA 如何识别屏幕上的内容并跟踪移动目标,而不是依赖于固定位置。以下是该目标背后的真实捕获、本地识别工作和开发检查。

VRA 已预发布。下面的专业探测器正在进行受控验证。探索此处的专家识别工作以及下面的后续实验模型路线图。

行业内部愿景/开发者现场笔记

一座移动的城市值得
不仅仅是一张匹配的图片。

一只鹿转身。一只羊走开了。光线发生变化。黄金向导留在后面。城市事件报告提出了一个比“这看起来和我的参考图像一模一样吗?”更难的问题。

专业检测器·受控验证

为什么这种自动化首先出现

城市事务将移动的动物、变化的光线和不同的风景纳入同一工作流程中。聚焦检测器可以学习这些不同视图之间共享的视觉模式。

我们正在训练一个聚焦视觉探测器,根据学习到的外观来定位动物身体或资源块。目标是随着场景的变化保持识别集中在当前对象上。

保留适合工作的工具

模板仍然有一席之地,用于稳定的界面控件。实验检测器解决了不断变化的场景,而确定性工作流程保留了权限、时间、恢复限制和验证。

认可提案必须仍符合当前的合格目标。它并不授权盲目点击或将尝试的操作转变为成功的操作。

打开现场笔记本

我们教它注意什么。
以及要忽略什么。

探索真实的例子。切换审查框以检查原始作物,然后比较动物、资源和故意否定。

鹿和羊。跨越不止一个姿势。

两者都在当前的训练集中体现,包括姿势和光照。他们共享一个 动物目标 标签:探测器正在了解动物尸体的位置,而不是产生物种名称。资源示例将课程扩展到浆果、木材、矿石/材料堆和钓鱼点。这是目前的训练范围,并未覆盖游戏中的每只动物。

该管道已经产生了可识别的目标和有限的动物收集试验。当前的开发扩大了识别范围并在实时工作流程检查中对其进行评估。

从捕获到候选

教导。挑战。
只保留那些能占据一席之地的东西。

当进度条到达末尾时,模型尚未完成。重要的问题是它在未经训练的示例上的表现如何。

  1. 01

    捕捉变化

    真实的游戏作物包括不同的姿势、光照、背景和部分障碍物。十个几乎相同的屏幕截图并不是十个独立的演示。

  2. 02

    回顾目标

    一个方框标记了可见的动物尸体或资源块。人、箱子和空地也很重要:它们向探测器显示什么不应该接收目标框。

  3. 03

    调整学习权重

    Offline training compares predictions with the reviewed labels and adjusts numerical parameters. We refine general visual foundations using VRA-specific examples; we are not teaching a model from a blank slate.

  4. 04

    保持评估分开

    训练示例更新模型。验证示例指导检查点选择。举出的例子测试了冻结的候选人。整个运行组呆在一起,并保留一个农场用于测试。

  5. 05

    先合格后控制

    我们检查导出的模型是否重现其参考预测,然后评估有限权限下的实时行为。看似合理的盒子不允许点击、花费或报告成功。

条款,没有神秘感

什么是
“训练举重”是什么意思?

这意味着改变学习到的数字参数——而不是为每只鹿编写规则,保存每个可能的屏幕截图,或者要求语言模型猜测点击哪里。

这个重点检测器工作与下面的后续实验视觉/语言模型路线图是分开的。

权重:模型实际学到的内容

权重是模型内部的数值参数。它们共同影响像素如何成为视觉特征以及这些特征如何成为建议的目标框。培训会调整它们以减少错误。它们不是手写坐标、屏幕截图匹配文件夹或置信百分比。

学习到的模式可以转移到另一个姿势。它还需要测试。
标签:我们要求它找到什么

此页面上的彩色框是经过审查的开发注释。他们告诉训练目标在哪里以及它属于哪个目标组。当作物没有相关目标时,故意使用空注释。这些标签不是实时模型预测或独立的人类认证的基本事实。

糟糕或模棱两可的标签可能会带来错误的教训,因此不确定的例子被排除在外。
损失:训练期间的反馈

损失衡量预测和训练标签之间的差异,包括目标分类和框放置。优化器使用该反馈来更新权重。仅较低的训练损失并不表明模型在不同的农场上表现更好。

学习训练示例并不等同于泛化。
检查点:保存的版本,不保证改进

检查点在训练的特定阶段保存模型。我们比较候选者的验证数据并保留最符合条件的版本,这可以是早期检查点而不是最终检查点。再进行三十分钟的训练并不会自动产生更好的模型。

将证据和版本放在一起。不要仅仅因为训练完成就推广模型。
信心:分数,而不是承诺

检测分数描述了模型对提议目标的支持。它并不是自动校准的概率,也不是可以点击目标的保证,也不是整个例程可靠性的衡量标准。在错误的对象上获得高分仍然是错误检测。

新的观察和行动验证仍然是必要的。
过度拟合:记住教训而不是学习规则

小型或重复的数据集可以使模型在熟悉的图像上看起来很出色,但会错过不同的姿势或背景。各种例子、分散的跑步小组、负面场景和保留的农场都有助于揭示这种差距。它们并没有消除更广泛测试的需要。

下一个不熟悉的动物比熟悉的框架上的另一个满分提供更多信息。

比令人信服的演示更高的标准

我们的目标是在不断变化的城市中获得可靠的认可。我们发布了该工作的一个小窗口,而不是私有数据集、模型权重或实现。画廊展示了当前的培训范围;专业探测器仍处于预发布开发阶段。

探索城市活动报告

发布时

  • 基于脚本的农场工作流程、证据和客户控制。
  • 正常 VRA 运行期间的可选示例收集。
  • 默认关闭同意、隐私控制、审查和撤销。
  • 在客户发布之前准备好贡献管道。

在以后的迭代中

  • Young Studio自己的实验性VRA视觉/语言模型。
  • 有关开发人员示例和允许的客户贡献的培训。
  • 与基于脚本的基线进行内部比较。
  • 仅在经过证明改进和合格后才发布。
01

脚本建立基线

初始版本将使用预制的确定性工作流程。他们记录观察到的内容、尝试的内容以及验证的内容。该记录将每个动作与其产生的游戏状态联系起来。

02

客户选择是否捐款

在发布时,可选数据集贡献是发布计划的一部分:通过明确选择加入,VRA 将在正常自动化期间选择有用的示例,应用隐私控制并将批准的示例贡献到 Young Studio 的 VRA 数据集。日常贡献不需要手动准备屏幕截图。

03

我们构建并训练 VRA 模型

We are building Young Studio’s own VRA model. We will train and evaluate it using teacher-labelled development examples and optional contributions from customers running VRA. Customers contribute examples—not train or maintain separate models themselves. Training and evaluation happen offline—not on the customer’s PC during a farm run.

04

该模型必须证明有改进

我们将在保留的示例和内部端到端运行中将候选模型版本与基于脚本的基线进行比较。完成工作、处理不确定性、尊重许可和避免意外行为比有说服力的预测更重要。

05

实验版本稍后发布

The experimental VRA vision/language model is planned for a later iteration—not the initial launch. We will release it only after internal testing demonstrates an improvement over the script-based automation baseline. Contributions do not immediately change a live farm’s behaviour. Qualified versions will arrive through VRA updates.

06

您的权限仍然具有权威性

无论工作流使用脚本还是合格的模型,支出权限、工作流限制和重放防护仍然是控制边界。模型无法授予自己许可或将不确定性转化为完整的结果。

您的数据不是默认数据

帮助改进VRA。
只要你选择。

该模型将是我们的。贡献示例的决定权仍由您决定。下降不会降低核心农场自动化程度。

阅读贡献隐私计划

查看观察结果

关注工作,而不仅仅是承诺。

检查真实的配对训练记录和验证结果背后的证据。一次演示并不是整个车队的可靠性基准。