使用xsl-fo,我想生成一个pdf-文件。pdf文件的文本是一个简单的、正在进行的纯文本,其中没有任何断行符.当我生成pdf时,pdf中有断行,所以在将文本复制到记事本之后,也有这些换行。我想要的是,在pdf中,有这些换行符,而不是在记事本中复制的文本中。示例this is a xsl-fo generated textthis is a xsl-fo由pdf复制粘贴而成的<
我正在尝试转换一个非常干净的PDF文件到txt文件使用python。我试过使用pyPDF2和PDFMiner,它们在文本识别方面都工作得很好。然而,由于在PDF中的行是换行的,提取的.txt文件在末尾有意外的换行符:例如,第1行:"is an account of the Elder /n Days,“。在"Elder“和"days”之间不应该有换行符。PDF文件:
当用Acrobat编辑时,可以清楚地看到<em
veriftype可以工作,但veriftype2不行。是不是因为我读取第二行的方法不准确?它正在读取的文本文件的每一行都有一个字符,或者是x,或者是o。我试着只使用f.read(2),但似乎两者都不起作用。我似乎找不到任何其他的问题来源,因为当我打印应该是该行的值的变量时,它给出了正确的值,但是if语句没有运行,它只是跳到else部分。 def veriftype(self): y = f.readline(1) if y == "x
我通常通过从pdf文件中复制/粘贴论文标题名称来命名论文。例如:peng2017-Induction of the pho regulon and polyphosphate synthesis?against spermine stress in Pseudomonas aeruginosa.pdf。问题是,在换行处(在上面示例中的“合成”一词之后)有一个奇怪的字符被复制并插入到文件名中,因此(rclone)备份程序无法识别这些文件。
我们怎样才能摆脱这些断线角色呢?命令rename 's/