首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >大模型剪枝 >大模型剪枝有哪些常用的评估指标?

大模型剪枝有哪些常用的评估指标?

词条归属:大模型剪枝

1. 语言建模指标

  • 困惑度(Perplexity, PPL):最常用的评估指标,衡量模型预测下一个 token 的能力。通常在 WikiText-2 测试集上计算,数值越低越好。一般来说,困惑度增加 1–2 点被认为是可接受的。
  • WikiText-2 / C4 / FineWeb:常用的语言建模评测数据集。

2. 下游任务指标

  • MMLU:大规模多任务语言理解基准,涵盖 57 个学科领域的知识问答。
  • ARC-Challenge / ARC-Easy:科学问题推理能力评估。
  • HellaSwag:常识推理能力评估。
  • WinoGrande:代词消歧能力评估。
  • BoolQ:是非问答题评估。
  • PIQA:物理常识推理评估。
  • GSM8K:数学推理能力评估,对剪枝极为敏感。
  • IFEval:指令遵循能力评估。
  • TruthfulQA:模型回答的真实性评估。

3. 效率指标

  • 推理延迟:单次推理的时间消耗(毫秒)。
  • 吞吐量(QPS):单位时间内处理的请求数。
  • 显存占用:模型加载和推理过程中的 GPU 显存消耗。
  • FLOPs:浮点运算次数,反映计算复杂度。
  • 压缩比:原始模型大小与压缩后模型大小的比值。

4. 可靠性指标

最新的 UniComp 评估框架还引入了可靠性维度,包括模型在多语言、文化多样性、安全性等方面的表现,以更全面地评估压缩模型的实际可用性。

相关文章
大语言模型中的常用评估指标
EM 是 exact match 的简称,所以就很好理解,em 表示预测值和答案是否完全一样。
BBuf
2023-08-22
4.9K0
我常用的大模型和Prompt有哪些?
以前提到过,我们公司鼓励大家多使用GPT这样的大模型,一方面能够提高工作效率,一方面使用的越多,越了解,越有可能发现应该怎么将其跟我们公司的产品结合起来。
panzhixiang
2024-10-30
4940
深度学习笔记 常用的模型评估指标
“没有测量,就没有科学。”这是科学家门捷列夫的名言。在计算机科学中,特别是在机器学习的领域,对模型的测量和评估同样至关重要。只有选择与问题相匹配的评估方法,我们才能够准确地发现在模型选择和训练过程中可能出现的问题,再对模型进行优化。本文将总结机器学习最常见的模型评估指标,其中包括:
叶庭云
2021-12-01
9840
“大模型安全评估”需要评估哪些?
随着大型语言模型(LLM)如ChatGPT、文心一言等在众多领域展现出前所未有的能力,其安全、可靠、负责任地部署与应用已成为全社会关注的焦点。大模型并非完美无缺,其内在风险可能带来严重的现实世界危害。因此,构建一套科学、系统、多维度的安全评估体系,不再是可选项,而是确保其健康发展的必然要求。#大模型备案##安全评估##生成式人工智能#
算法大模型-丁香
2025-08-26
8950
【杂谈】当前模型剪枝有哪些可用的开源工具?
模型剪枝属于模型优化中的重要技术之一,经过了研究人员多年的研究,工业界也开始有一些实践,那么当前有哪些可用的模型剪枝工具呢?
用户1508658
2019-12-25
2.1K0
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券