网络编程
位置:首页>> 网络编程>> Python编程>> Python产生batch数据的操作

Python产生batch数据的操作

作者:小小黄01  发布时间:2022-11-22 16:00:59 

标签:Python,batch,数据

产生batch数据

输入data中每个样本可以有多个特征,和一个标签,最好都是numpy.array格式。

datas = [data1, data2, …, dataN ], labels = [label1, label2, …, labelN],

其中data[i] = [feature1, feature2,…featureM], 表示每个样本数据有M个特征。

输入我们方法的数据,all_data = [datas, labels] 。

代码实现

通过索引值来产生batch大小的数据,同时提供是否打乱顺序的选择,根据随机产生数据量范围类的索引值来打乱顺序。


import numpy as np
def batch_generator(all_data , batch_size, shuffle=True):
"""
:param all_data : all_data整个数据集,包含输入和输出标签
:param batch_size: batch_size表示每个batch的大小
:param shuffle: 是否打乱顺序
:return:
"""
# 输入all_datas的每一项必须是numpy数组,保证后面能按p所示取值
all_data = [np.array(d) for d in all_data]
# 获取样本大小
data_size = all_data[0].shape[0]
print("data_size: ", data_size)
if shuffle:
 # 随机生成打乱的索引
 p = np.random.permutation(data_size)
 # 重新组织数据
 all_data = [d[p] for d in all_data]
batch_count = 0
while True:
 # 数据一轮循环(epoch)完成,打乱一次顺序
 if batch_count * batch_size + batch_size > data_size:
  batch_count = 0
  if shuffle:
   p = np.random.permutation(data_size)
   all_data = [d[p] for d in all_data]
 start = batch_count * batch_size
 end = start + batch_size
 batch_count += 1
 yield [d[start: end] for d in all_data]

测试数据

样本数据x和标签y可以分开输入,也可以同时输入。


# 输入x表示有23个样本,每个样本有两个特征
# 输出y表示有23个标签,每个标签取值为0或1
x = np.random.random(size=[23, 2])
y = np.random.randint(2, size=[23,1])
count = x.shape[0]
batch_size = 5
epochs = 20
batch_num = count // batch_size
batch_gen = batch_generator([x, y], batch_size)
for i in range(epochs):
print("##### epoch %s ##### " % i)
for j in range(batch_num):
 batch_x, batch_y = next(batch_gen)
 print("-----epoch=%s, batch=%s-----" % (i, j))
 print(batch_x, batch_y)

补充:使用tensorflow.data.Dataset构造batch数据集


import tensorflow as tf
import numpy as np
def _parse_function(x):
num_list = np.arange(10)
return num_list
def _from_tensor_slice(x):
return tf.data.Dataset.from_tensor_slices(x)
softmax_data = tf.data.Dataset.range(1000) # 构造一个队列
softmax_data = softmax_data.map(lambda x:tf.py_func(_parse_function, [x], [tf.int32]))# 将数据进行传入
softmax_data = softmax_data.flat_map(_from_tensor_slice) #将数据进行平铺, 将其变为一维的数据,from_tensor_slice将数据可以输出
softmax_data = softmax_data.batch(1) #构造一个batch的数量
softmax_iter = softmax_data.make_initializable_iterator() # 构造数据迭代器
softmax_element = softmax_iter.get_next() # 获得一个batch的数据
sess = tf.Session()
sess.run(softmax_iter.initializer) # 数据迭代器的初始化操作
print(sess.run(softmax_element)) # 实际获得一个数据
print(sess.run(softmax_data))

以上为个人经验,希望能给大家一个参考,也希望大家多多支持脚本之家。如有错误或未考虑完全的地方,望不吝赐教。

来源:https://blog.csdn.net/huanghaocs/article/details/83242353

0
投稿

猜你喜欢

  • 可变长参数GO语言允许一个函数把任意数量的值作为参数,GO语言内置了**...操作符,在函数的最后一个形参才能使用...**操作符,使用它必
  • 最近一直在研究 Javascript 相关的技术。在《Javascript 高级程序设计》有篇章节着重阐述了优化 Javascri
  • 前段时间我们部门的粉丝和布林同学都写过关于这个问题的文章。刚好阅读了关于这个问题的其他争论文章。所以顺便在这补充几点。首先说明这里讨论的是在
  • 在XHTML标签中有一些标签的作用是相似的,当然这里的相似是指语义相似,以至于很多人都不清楚这些相似的标签如何使用,那么今天的主题就是分解相
  • 随着网站的内容的增多和用户访问量的增多,无可避免的是网站加载会越来越慢,受限于带宽和服务器同一时间的请求次数的限制,我们往往需要在此时对我们
  • 生生把写过的java版改成javascript版,第一次写,很不专业,见谅。唉,我是有多闲。var Sudoku = { &nbs
  • 完整的示例代码如下: 代码如下:<%@LANGUAGE="JAVASCRIPT" CODEPAGE="6
  • <?php   $fp = fopen("http://www.***.com/**
  •  <base href="http://digi.tech.qq.com/images/ld/2007/1022/
  • MySQL使用环境变量TMPDIR的值作为保存临时文件的目录的路径名。如果未设置TMPDIR,MySQL将使用系统的默认值,通常为/tmp、
  • 大家都知道,数据库的安全性是很重要的,它直接影响到数据库的广泛应用。用户可以采用任意一种方法来保护数据库应用程序,也可以将几种方法结合起来使
  • 在SQL Server数据库中,主要是通过角色来继承相关的权限。但是,这个权限继承很容易造成权限上的冲突。如现在有个销售员账户SALE1,有
  • 前段时间开始学习JSON在ASP中的使用,JSON确实比XML方便。以前在写程序的时候有考虑使用XML来存储数据,但是一直觉得生成文档及文档
  • 1. position:static所有元素的默认定位都是:position:static,这意味着元素没有被定位,而且在文档中出现在它应该
  • 本文实例讲述了Python栈的实现方法。分享给大家供大家参考,具体如下:Python实现栈栈的数组实现:利用python列表方法代码如下:#
  • 一直很想就搜索结果页写一些心得文章出来,甚至连目录都整理好了可是就是一直没有动手。因为总是觉得还差很多东西需要研究需要分析需要验证。最近也组
  • 第一个保存在新建一个文本中<% Dim Username,PassWord,strLogFile,f,ff,Str
  • 重读LukeW的《Web Form Design:Filling in the Blanks》感触很深,除佩服LukeW的钻研精神外,更多的
  • 分页浏览功能是常见的Web应用功能,对于MySQL数据库来说可以很轻松的使用limit语句实现分页,而对于SQL Server数据库来说,常
  • 今天写了一个放迅雷焦点广告的效果,还请大家多多指正,先附上效果图一张:相关文章:迅雷首页新闻图片轮播效果js源码首先是JS代码部分,之前一定
手机版 网络编程 asp之家 www.aspxhome.com