随着大模型能力趋近饱和,传统静态基准(如MMLU)的评测价值日益衰减,且易被针对性地刷分。我们是否需要从“考试型评测”转向“生态型评测”——将模型置于持续交互、...
随着大模型能力趋近饱和,传统静态基准(如MMLU)的评测价值日益衰减,且易被针对性地刷分。我们是否需要从“考试型评测”转向“生态型评测”——将模型置于持续交互、开放环境与多智能体协作的真实任务流中进行评估?这种转型面临哪些核心挑战?如何确保可复现性、公平性与效率?
👁 7 浏览 · 2026/7/18
0 个回答