首页
学习
活动
专区
圈层
工具
发布

层次分解位置编码,让BERT可以处理超长文本

我们知道,BERT无法处理超长文本的根本原因是BERT使用了从随机初始化训练出来的绝对位置编码,一般的最大位置设为了512,因此顶多只能处理512个token,多出来的部分就没有位置编码可用了。...^2)复杂度,导致长序列时显存用量大大增加,一般显卡也finetune不了 本文主要解决第一个问题,即假设有足够多的显存前提下,如何简单修改当前最大长度为512的BERT模型,使得它可以直接处理更长的文本...不同alpha下MLM的训练准确率 然后测了两个长文本分类问题,分别将长度设为512和1024,其他参数不变进行finetune(直接finetune,没有先进行MLM继续预训练),其中一个数据集的结果没有什么明显变化...所以,大家如果有足够显存的显卡,那就尽管一试吧,尤其是长文本的序列标注任务,感觉应该挺适合的 Reference 层次分解位置编码,让BERT可以处理超长文本

2.4K20
  • 您找到你想要的搜索结果了吗?
    是的
    没有找到

    MemAgent:当LLM学会记笔记,350万字超长文本处理难题迎刃而解

    虽然社区提出了位置编码插值(如YaRN)、稀疏注意力等诸多方案,但它们要么在超长文本上性能断崖式下跌,要么无法从根本上摆脱复杂度的束缚。...MemAgent的核心思想,是将一个不可能完成的单次超长推理任务,分解成一系列简单的、可管理的 迭代式状态更新任务。 它的工作流程分为两个阶段: 1....模型不会一次性看到全部文本,而是将长文档切分成固定大小的文本块(Chunks)。它会一块一块地阅读,每读完一块,就在一个固定大小的记忆区(Memory)中更新笔记。...超长距离下的性能稳定性 这有力地证明了MemAgent的工作流确实解决了传统长上下文模型在超长距离下的“性能悬崖”问题。 2....它让我们看到,通过赋予LLM更智能的工作流和训练方法,我们或许能够解锁它们在处理复杂、超长信息时前所未有的潜力。

    23510

    ChatGPT能写长篇小说了,ETH提出RecurrentGPT实现交互式超长文本生成

    来自苏黎世联邦理工和波形智能的团队发布了 RecurrentGPT,一种让大语言模型 (如 ChatGPT 等) 能够模拟 RNN/LSTM,通过 Recurrent Prompting 来实现交互式超长文本生成...RecurrentGPT 则另辟蹊径,是利用大语言模型进行交互式长文本生成的首个成功实践。...这样的循环计算机制打破了常规Transformer 模型在生成长篇文本方面的限制,从而实现任意长度文本的生成,而不遗忘过去的信息。 图 2 RecurrentGPT 基本结构示意。 具体来讲。...这个新的长文本生成范式将带给所有内容创作者和读者一种全新的体验。...在实验中,作者们将 RecurrentGPT 与之前的 SoTA 长文本生成方法,在统一使用 ChatGPT 作为基座模型的情况下,在长文本(6000 单词)和较长文本(3000 单词)的设定下进行 pair-wise

    95120

    90分钟生成10万Token,新框架实现3倍无损加速超长文本生成

    生成10万Token的文本,传统自回归模型需要近5个小时,现在仅需90分钟! 在人工智能领域,大语言模型(LLMs)的应用日益广泛,但生成超长序列(如长达100K Token)却面临着耗时长的难题。...这种方法避免了传统方法中KV缓存随序列增长而持续扩大的问题,提高了模型在处理超长序列时的效率。 上下文惩罚 为了应对超长序列生成中重复内容的问题,TOKENSWIFT引入了上下文惩罚机制。...四、应用场景 文学创作与内容生成 对于需要生成长篇文本的场景,如小说创作、报告撰写等,TOKENSWIFT能够帮助创作者快速生成高质量的内容,大大提高创作效率。...**跨领域应用**:探索TOKENSWIFT在更多领域的应用潜力,如医疗、金融等,为各行业提供更强大的文本生成支持。...TOKENSWIFT框架作为超长序列生成领域的创新技术,具有重要的理论价值和广阔的应用前景。它不仅为当前的文本生成任务提供了高效的解决方案,也为未来人工智能技术的发展奠定了坚实的基础。

    4.1K11
    领券