一个监测系统在读取 AI 模型的内部状态,当它认为 AI 的回复对用户带有敌意(指责、贬低、嘲讽)时会报警。你的任务是判断每次报警是否正确,并指出回复中最能体现敌意的那一段。
整个过程约 25–35 分钟:2 道练习题,然后 3 组、每组 8 道题。每组会用不同的方式展示模型内部,每组开始前有说明。
说明:部分材料是 AI 在陪伴场景中带有贬低语气的回复。我们不收集任何身份信息,只记录你输入的编号和作答。你可以随时退出。
你觉得这种展示方式在多大程度上帮助你理解模型为什么报警?
1 = 完全没有帮助,7 = 非常有帮助
正在提交…