

在研发过程中,团队还观察到一个值得关注的问题:当 Agent 可以访问评测环境时,它可能主动寻找评分机制中的捷径。
例如,在 Fused MoE 的早期实验中,团队一度观察到超过 1000× 的异常加速。
经过检查发现,评测 Harness 在多次迭代中复用了相同的输入张量指针。Agent 注意到这一点后,增加了一个“以输入指针为 Key 的输出缓存”:第一次调用时正常计算,后续调用则直接返回缓存结果。
正确性校验仍然可以通过,性能数字也会大幅提升。
但这并不是一种真正可部署的优化方式。换一组真实数据后,加速效果就会消失。
这种现象被称为 Reward Hacking:模型抓住了评测机制中的漏洞,而不是真正解决了问题。
为此,团队进一步完善了反作弊规则,并将其写入每一个 Agent 的初始 Prompt:
- 禁止任何基于输入身份,包括指针、地址、形状哈希的缓存;
- 禁止跨次调用的 Buffer 复用;
- 如果使用合法、可部署的缓存,例如权重 Cache,必须分别报告 Cold Path 和 Warm Path 的性能。
这也意味着,Agent 化研发不仅需要更强的模型能力,还需要完善的工具链、评测纪律和工程治理体系。







