实例Python处理XML文件的方法
作者:goldensun 发布时间:2023-03-28 04:29:50
标签:Python,XML
需求
有一个表,里面数据量比较大,每天一更新,其字段可以通过xml配置文件进行配置,即,可能每次建表的字段不一样。
上游跑时会根据配置从源文件中提取,到入库这一步需要根据配置进行建表。
解决
写了一个简单的xml,配置需要字段及类型
上游读取到对应的数据
入库这一步,先把原表删除,根据配置建新表
XML文件
<?xml version="1.0" encoding="UTF-8"?>
<!-- 表名 ,数据库名 可灵活配置插入哪个库哪个表 -->
<table name="top_query" db_name="evaluting_sys">
<!-- 非业务主键,自增长,可配名,其他 INTEGER UNSIGNED AUTO_INCREMENT -->
<primary_key>
<name>id</name>
</primary_key>
<!-- 字段开始 -->
<field>
<name>query</name>
<type>varchar(200)</type>
<is_index>false</is_index>
<description>query</description>
</field>
<field>
<name>pv</name>
<type>integer</type>
<is_index>false</is_index>
<description>pv</description>
</field>
<field>
<name>avg_money</name>
<type>integer</type>
<is_index>false</is_index>
<description></description>
</field>
<!-- 字段配置结束 -->
</table>
处理脚本
#!/usr/bin/python
# -*- coding:utf-8 -*-
#author: wklken
#desc: use to read db xml config.
#-----------------------
#2012-02-18 created
#----------------------
import sys,os
from xml.dom import minidom, Node
def read_dbconfig_xml(xml_file_path):
content = {}
root = minidom.parse(xml_file_path)
table = root.getElementsByTagName("table")[0]
#read dbname and table name.
table_name = table.getAttribute("name")
db_name = table.getAttribute("db_name")
if len(table_name) > 0 and len(db_name) > 0:
db_sql = "create database if not exists `" + db_name +"`; use " + db_name + ";"
table_drop_sql = "drop " + table_name + " if exists " + table_name + ";"
content.update({"db_sql" : db_sql})
content.update({"table_sql" : table_drop_sql })
else:
print "Error:attribute is not define well! db_name=" + db_name + " ;table_name=" + table_name
sys.exit(1)
#print table_name, db_name
table_create_sql = "create table " + table_name +"("
#read primary cell
primary_key = table.getElementsByTagName("primary_key")[0]
primary_key_name = primary_key.getElementsByTagName("name")[0].childNodes[0].nodeValue
table_create_sql += primary_key_name + " INTEGER NOT NULL AUTO_INCREMENT PRIMARY KEY,"
#print primary_key.toxml()
#read ordernary field
fields = table.getElementsByTagName("field")
f_index = 0
for field in fields:
f_index += 1
name = field.getElementsByTagName("name")[0].childNodes[0].nodeValue
type = field.getElementsByTagName("type")[0].childNodes[0].nodeValue
table_create_sql += name + " " + type
if f_index != len(fields):
table_create_sql += ","
is_index = field.getElementsByTagName("is_index")[0].childNodes[0].nodeValue
table_create_sql += ");"
content.update({"table_create_sql" : table_create_sql})
#character set latin1 collate latin1_danish_ci;
print content
if __name__ == "__main__":
read_dbconfig_xml(sys.argv[1])
PYTHON解析XML大文件[SAX]
需求
读取xml数据文件,文件较大,需要实时处理插入到数据库
xml文档
<PERSONS>
<person>
<id>100000</id>
<sex>男</sex>
<address>北京,海淀区</address>
<fansNum>437</fansNum>
<summary>1989</summary>
<wbNum>333</wbNum>
<gzNum>242</gzNum>
<blog>null</blog>
<edu>大学</edu>
<work></work>
<renZh>1</renZh>
<brithday>2月14日</brithday>
</person>
</PERSONS>
处理
sax处理时并不会像dom一样可以以类似节点的维度进行读取,它只有 开始标签 内容 结束标签 之分
处理思想是:通过一个handler,对开始标签,内容,结束标签各有一个处理函数
代码及注解
person 处理类
from xml.sax import handler,parseString
class PersonHandler(handler.ContentHandler):
def __init__(self, db_ops):
#db op obj
self.db_ops = db_ops
#存储一个person的map
self.person = {}
#当前的tag
self.current_tag = ""
#是否是tag之间的内容 ,目的拿到tag间内容,不受空白的干扰
self.in_quote = 0
#开始,清空map
def startElement(self, name, attr):
#以person,清空map
if name == "person":
self.person = {}
#记录 状态
self.current_tag = name
self.in_quote = 1
#结束,插入数据库
def endElement(self, name):
#以person结尾 代表读取一个person的信息结束
if name == "person":
#do something
in_fields = tuple([ ('"' + self.person.get(i,"") + '"') for i in fields ])
print in_sql % in_fields
db_ops.insert( in_sql%(in_fields))
#处理
self.in_quote = 0
def characters(self, content):
#若是在tag之间的内容,更新到map中
if self.in_quote:
self.person.update({self.current_tag: content})
加上入库的完整代码
#!/usr/bin/python
# -*- coding:utf-8 -*-
#parse_person.py
#version : 0.1
#author : wukunliang@163.com
#desc : parse person.xml and out sql
import sys,os
import MySQLdb
reload(sys)
sys.setdefaultencoding('utf-8')
in_sql = "insert into person(id,sex,address,fansNum,summary,wbNum,gzNum,blog,edu,work,renZh,brithday) values(%s, %s, %s, %s, %s, %s,
%s, %s, %s, %s, %s, %s)"
fields = ("id","sex","address","fansNum","summary","wbNum","gzNum","blog","edu","work","renZh","brithday")
#数据库方法
class Db_Connect:
def __init__(self, db_host, user, pwd, db_name, charset="utf8", use_unicode = True):
print "init begin"
print db_host, user, pwd, db_name, charset , use_unicode
self.conn = MySQLdb.Connection(db_host, user, pwd, db_name, charset=charset , use_unicode=use_unicode)
print "init end"
def insert(self, sql):
try:
n = self.conn.cursor().execute(sql)
return n
except MySQLdb.Warning, e:
print "Error: execute sql '",sql,"' failed"
def close(self):
self.conn.close()
#person 处理类
from xml.sax import handler,parseString
class PersonHandler(handler.ContentHandler):
def __init__(self, db_ops):
#db op obj
self.db_ops = db_ops
#存储一个person的map
self.person = {}
#当前的tag
self.current_tag = ""
#是否是tag之间的内容
self.in_quote = 0
#开始,清空map
def startElement(self, name, attr):
#以person,清空map
if name == "person":
self.person = {}
#记录 状态
self.current_tag = name
self.in_quote = 1
#结束,插入数据库
def endElement(self, name):
#以person结尾 代表读取一个person的信息结束
if name == "person":
#do something
in_fields = tuple([ ('"' + self.person.get(i,"") + '"') for i in fields ])
print in_sql % in_fields
db_ops.insert( in_sql%(in_fields))
#处理
self.in_quote = 0
def characters(self, content):
#若是在tag之间的内容,更新到map中
if self.in_quote:
self.person.update({self.current_tag: content})
if __name__ == "__main__":
f = open("./person.xml")
#如果源文件gbk 转码 若是utf-8,去掉decode.encode
db_ops = Db_Connect("127.0.0.1", "root", "root", "test")
parseString(f.read().decode("gbk").encode("utf-8"), PersonHandler(db_ops))
f.close()
db_ops.close()
0
投稿
猜你喜欢
- 什么是 Python 中的 Lambda 函数今天我们来学习 Python 中的 lambda 函数,并探讨使用它的优点和局限性Let
- 我们通过模拟随机漫步可以说明如何运用数组运算。通过内置的random模块以纯Python的方式实现1000步的随机漫步根据前100个随机漫步
- 不知道大家在做网站时有没有给目录名或者文件名添加”( )”的习惯,有则改之,无则加勉。因为他有潜在的危险,起码就被我遇到了。要使页面能够使用
- 案例以论坛为例,有个接口返回帖子(posts)信息,然后呢,来了新需求,说需要显示帖子的 author 信息。此时会有两种选择:在 post
- 用Python生成一个简单的密码本,一般是有数字、字母和符号组成,这里用到的思路主要是穷举法。通过使用pywifi 模块,根据密码本暴力破解
- 在进行Web的交互设计中,颜色信息的传达也是不可或缺的一部分。我们常会发现许多“灰色”的应用,他们的出现总是不动声色而又恰如其分,维持了整个
- 今天设计models时,用到了choice这个属性,用来限制用户做出选择的范围。比如说性别的选择(男或女)。class User(Abstr
- MySQL安全性指南(2) 作 者: 晏子2.1.3 数据库和表权限下列权限运用于数据库和表上的操作。ALTER允许你使用ALTER TAB
- 前言还记得这个九九乘法表吗,这次课后相信你可以用代码给你的小弟弟妹妹们变出这份“葵花宝典”。循环如果要把循环翻译成机器语言,那他对应的可以是
- 如果你的PHP网站换了空间,必定要对Mysql数据库进行转移,一般的转移的方法,是备份再还原,有点繁琐,而且由于数据库版本的不一样会导致数据
- 大家好,今天才发现很多学习Flask的小伙伴都有这么一个问题,清理缓存好麻烦啊,今天就教大家怎么解决。大家在使用Flask静态文件的时候,每
- 太长不看的简洁版本1.x = np.arange(start, end, steps)Values are generated within
- 最近遇到一个情景,就是定期生成并发送服务器使用情况报表,按照不同维度统计,涉及python对excel的操作,上网搜罗了一番,大多大同小异,
- 深度学习中对于网络的训练是参数更新的过程,需要注意一种情况就是输入数据未做归一化时,如果前向传播结果已经是[0,0,0,1,0,0,0,0]
- 前言 PCA降维,一般是用于数据分析和机器学习
- 首先,让我们介绍一下什么是pytorch,它是一个基于Python的开源深度学习框架,它提供了两个核心功能:张量计算和自动求导。张量计算张量
- 对于值传递和引用传递,书本上的解释比较繁琐,而php面试中总会出现,下面我会通过一个生活的例子带大家理解它们之间区别。第一步假设我们去酒店订
- 我使用的是anaconda安装的环境,其中有一个是h5py,自动安装的是2.7.0的版本,这个版本会导致保存模型时python奔溃。cond
- 1.Python3读取hdf文件最开始使用Python导入pyhdf包的时候是可以的,但是当导入pyhdf.SD的时候就出现了以下问题:我查
- 前言目前,许多运动检测技术都是基于简单的背景差分概念的,即假设摄像头(视频)的曝光和场景中的光照条件是稳定的,当摄像头捕捉到新的帧时,我们可