现代文本分类方法严重依赖大语言模型(LLM)的上下文嵌入。与人工设计的特征相比,这些嵌入为分类模型训练提供了自动有效的表示,但也带来了挑战:由于LLM嵌入的不透明性和难以解释性,我们无法手动移除非预期特征(如敏感或任务无关特征)以保证监管合规性或提升分类模型的泛化能力。
提出了一种新颖的框架来识别和正则化LLM潜在空间中的非预期特征。具体包括:
在三个实际任务中评估了所提框架:
结果表明,通过正则化那些与任务语义不相关的特征,所提出的自正则化框架能够有效提升分类器的泛化能力。
本研究首次利用可解释特征在LLM潜在空间上实现可控文本分类,为解决泛化性、公平性和隐私挑战提供了新思路。代码和数据已公开。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。