1. 语言建模指标
- 困惑度(Perplexity, PPL):最常用的评估指标,衡量模型预测下一个 token 的能力。通常在 WikiText-2 测试集上计算,数值越低越好。一般来说,困惑度增加 1–2 点被认为是可接受的。
- WikiText-2 / C4 / FineWeb:常用的语言建模评测数据集。
2. 下游任务指标
- MMLU:大规模多任务语言理解基准,涵盖 57 个学科领域的知识问答。
- ARC-Challenge / ARC-Easy:科学问题推理能力评估。
- HellaSwag:常识推理能力评估。
- WinoGrande:代词消歧能力评估。
- BoolQ:是非问答题评估。
- PIQA:物理常识推理评估。
- GSM8K:数学推理能力评估,对剪枝极为敏感。
- IFEval:指令遵循能力评估。
- TruthfulQA:模型回答的真实性评估。
3. 效率指标
- 推理延迟:单次推理的时间消耗(毫秒)。
- 吞吐量(QPS):单位时间内处理的请求数。
- 显存占用:模型加载和推理过程中的 GPU 显存消耗。
- FLOPs:浮点运算次数,反映计算复杂度。
- 压缩比:原始模型大小与压缩后模型大小的比值。
4. 可靠性指标
最新的 UniComp 评估框架还引入了可靠性维度,包括模型在多语言、文化多样性、安全性等方面的表现,以更全面地评估压缩模型的实际可用性。