开发者头像
@AndyTalk开发者

该作者很懒,懒得留下多余的个人简介

项目简介

mimo-radar是用于监测Xiaomi MiMO系列大模型智商趋势的工具网站。它每周至少进行一次Benchmark,获取智商基准。此外,每天高频率地进行心跳测试,监测是否存在智商波动。如 Confirm 确认降智,则立即补跑一次正式Benchmark。

本工具不关注mimo的横评智商,不与其他厂商的模型智商对比。只监测mimo各模型同比、环比是否出现了智商波动,以此来帮助MiMO用户在生产前,确定该用什么模型最能保质量,或最有性价比。

之所以开发这个工具,是因为作者@AndyTalk发现:

1.Cxxxde存在地域、订阅等级等歧视性政策,根据不同情况分配模型智商,很多时候,看似你和其他用户调用的都是xx模型,但因为各种因素,你的其实是降智版;

2.Codex各模型普遍存在智商波动,同一天的不同时段,更贵的模型、更高的思考等级反而可能效果不如自家的其他模型。

为了避免MiMO用户也遭遇类似困扰,所以我开发了这个工具。为防止MiMO官方将来注意到本项目并对抗测试集,题库暂不开源并定期更换。由于我们不关心横评智商,而只是关注其有无智商波动,所以不必在意题库变更。必须说明的是,模型有智商波动是正常的,任何厂商无法避免,主客观因素何其多。我们要做的是选择最佳模型生产,而不是把本工具当做攻击MiMO官方的刀子。

最后,本项目由于需要高频跑测试,所以维护成本极高。(本人不用MiMO作为生产主力,充值只为给大家做测评)。但你无需为此付费,有空就去我的B站投个币、点个赞即可。一旦识别到相关视频互动数据变更,本站会立即触发一次测试,数据会得到额外刷新。另外,如果你有更好的探针测试题目、完整测试集等,欢迎github、B站反馈。用更少的题目、更少地耗时完成测试,以便于大家能获得时效性更高的智商数据。