我使用 python sax 来解析 xml 文件。
xml文件实际上是多个xml文件的组合。
看起来如下:
<row name="abc" age="40" body="blalalala..." creationdate="03/10/10" />
<row name="bcd" age="50" body="blalalala..." creationdate="03/10/09" />
我的Python代码如下。它显示“文档元素后的垃圾”错误。有什么好主意可以解决这个问题。谢谢。
from xml.sax.handler import ContentHandler
from xml.sax import make_parser,SAXException
import sys
class PostHandler (ContentHandler):
def __init__(self):
self.find = 0
self.buffer = ''
self.mapping={}
def startElement(self,name,attrs):
if name == 'row':
self.find = 1
self.body = attrs["body"]
print attrs["body"]
def character(self,data):
if self.find==1:
self.buffer+=data
def endElement(self,name):
if self.find == 1:
self.mapping[self.body] = self.buffer
print self.mapping
parser = make_parser()
handler = PostHandler()
parser.setContentHandler(handler)
try:
parser.parse(open("2.xml"))
except SAXException:
xmldata = '''
<row name="abc" age="40" body="blalalala..." creationdate="03/10/10" />
<row name="bcd" age="50" body="blalalala..." creationdate="03/10/09" />
'''
在数据周围添加包装标签。我使用了 ElementTree,因为它更简单,但您可以在任何解析器上执行相同的操作:
from xml.etree import ElementTree as etree
# wrap the data
xmldata = '<rows>' +data + '</rows>'
rows = etree.fromstring(xmldata)
for row in rows:
print row.attrib
结果是
{'age': '40',
'body': 'blalalala...',
'creationdate': '03/10/10',
'name': 'abc'}
{'age': '50',
'body': 'blalalala...',
'creationdate': '03/10/09',
'name': 'bcd'}
本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系:hwhale#tublm.com(使用前将#替换为@)