如何使用python将pdf解析成xml或者html

pdf文件是来自ietf的rfc文档，pdf文件数据如图一。
我需要实现的功能是将pdf解析成xml或html，从而取出文章中的各种部分的信息。单从内容来看，内容有点像是xml格式，但是我无法使用xml.etree来解析。
我目前使用的是fitz，但是解析出来的html效果如图二所示，pdf文件中所有标签的属性均消失了，只剩下了文本内容。这样解析出来的内容，我很难去定位信息位置。
所以，请问一下，该如何将这种样子的pdf文件解析成xml或者html文件（最好直接沿用原先的标签名和属性）？

这要看里面是什么内容了