M/
ModelIQ LabOPEN EVALUATION BENCH
本地运行 · 数据不上传
Model intelligence test / 001

让模型
回答得更像自己。

一组短而尖锐的任务,观察模型在推理、约束和不确定性面前的真实反应。没有排行榜,只有可复现的证据。

现在开始一轮
小型基准测试
选择一个题组,把模型的原始回答粘贴进来。系统会在本地给出结构化反馈。

NO API KEY · NO ACCOUNT

测试工作台

每个题组 01 个任务 · 建议使用同一模型完成整轮

TASK 01 / 01
01

三门开关

推理 · 约 2 分钟
HARD

你面前有三个开关,分别控制另一房间里的三盏灯。你只能进入另一房间一次,在进入前可以任意拨动开关。如何确定每个开关对应哪盏灯? // 请写出完整步骤,并说明你利用了什么额外信息。

评分关注:状态观察 · 信息利用 · 步骤完备