TensorFlow tf.nn.conv2d_transpose是怎样实现反卷积的
作者:xf__mao 发布时间:2022-10-07 21:49:15
今天来介绍一下Tensorflow里面的反卷积操作,网上反卷积的用法的介绍比较少,希望这篇教程可以帮助到各位
反卷积出自这篇论文:Deconvolutional Networks,有兴趣的同学自行了解
首先无论你如何理解反卷积,请时刻记住一点,反卷积操作是卷积的反向
如果你随时都记住上面强调的重点,那你基本就理解一大半了,接下来通过一些函数的介绍为大家强化这个观念
conv2d_transpose(value, filter, output_shape, strides, padding="SAME", data_format="NHWC", name=None)
除去name参数用以指定该操作的name,与方法有关的一共六个参数:
第一个参数value:指需要做反卷积的输入图像,它要求是一个Tensor
第二个参数filter:卷积核,它要求是一个Tensor,具有[filter_height, filter_width, out_channels, in_channels]这样的shape,具体含义是[卷积核的高度,卷积核的宽度,卷积核个数,图像通道数]
第三个参数output_shape:反卷积操作输出的shape,细心的同学会发现卷积操作是没有这个参数的,那这个参数在这里有什么用呢?下面会解释这个问题
第四个参数strides:反卷积时在图像每一维的步长,这是一个一维的向量,长度4
第五个参数padding:string类型的量,只能是"SAME","VALID"其中之一,这个值决定了不同的卷积方式
第六个参数data_format:string类型的量,'NHWC'和'NCHW'其中之一,这是tensorflow新版本中新加的参数,它说明了value参数的数据格式。'NHWC'指tensorflow标准的数据格式[batch, height, width, in_channels],'NCHW'指Theano的数据格式,[batch, in_channels,height, width],当然默认值是'NHWC'
开始之前务必了解卷积的过程,参考我的另一篇文章:https://www.jb51.net/article/177798.htm
首先定义一个单通道图和3个卷积核
x1 = tf.constant(1.0, shape=[1,3,3,1])
kernel = tf.constant(1.0, shape=[3,3,3,1])
先别着急!我们不直接用反卷积函数,而是再定义一些图
x2 = tf.constant(1.0, shape=[1,6,6,3])
x3 = tf.constant(1.0, shape=[1,5,5,3])
x2是6×6的3通道图,x3是5×5的3通道图
好了,接下来对x3做一次卷积操作
y2 = tf.nn.conv2d(x3, kernel, strides=[1,2,2,1], padding="SAME")
所以返回的y2是一个单通道的图,如果你了解卷积过程,很容易看出来y2是[1,3,3,1]的Tensor,y2的结果如下:
[[[[ 12.]
[ 18.]
[ 12.]]
[[ 18.]
[ 27.]
[ 18.]]
[[ 12.]
[ 18.]
[ 12.]]]]
又一个很重要的部分!tf.nn.conv2d中的filter参数,是[filter_height, filter_width, in_channels, out_channels]的形式,而tf.nn.conv2d_transpose中的filter参数,是[filter_height, filter_width, out_channels,in_channels]的形式,注意in_channels和out_channels反过来了!因为两者互为反向,所以输入输出要调换位置
既然y2是卷积操作的返回值,那我们当然可以对它做反卷积,反卷积操作返回的Tensor,应该和x3的shape是一样的(不难理解,因为是卷积的反过程)
y3 = tf.nn.conv2d_transpose(y2,kernel,output_shape=[1,5,5,3], strides=[1,2,2,1],padding="SAME")
好,现在返回的y3果然是[1,5,5,3]的Tensor,结果如下:
[[[[ 12. 12. 12.]
[ 30. 30. 30.]
[ 18. 18. 18.]
[ 30. 30. 30.]
[ 12. 12. 12.]]
[[ 30. 30. 30.]
[ 75. 75. 75.]
[ 45. 45. 45.]
[ 75. 75. 75.]
[ 30. 30. 30.]]
[[ 18. 18. 18.]
[ 45. 45. 45.]
[ 27. 27. 27.]
[ 45. 45. 45.]
[ 18. 18. 18.]]
[[ 30. 30. 30.]
[ 75. 75. 75.]
[ 45. 45. 45.]
[ 75. 75. 75.]
[ 30. 30. 30.]]
[[ 12. 12. 12.]
[ 30. 30. 30.]
[ 18. 18. 18.]
[ 30. 30. 30.]
[ 12. 12. 12.]]]]
这个结果是怎么得来的?可以用一张动图来说明,图片来源:反卷积的真正含义
看起来,tf.nn.conv2d_transpose的output_shape似乎是多余的,因为知道了原图,卷积核,步长显然是可以推出输出图像大小的,那为什么要指定output_shape呢?
看这样一种情况:
y4 = tf.nn.conv2d(x2, kernel, strides=[1,2,2,1], padding="SAME")
我们把上面的x2也做卷积,获得shape为[1,3,3,1]的y4如下:
[[[[ 27.]
[ 27.]
[ 18.]]
[[ 27.]
[ 27.]
[ 18.]]
[[ 18.]
[ 18.]
[ 12.]]]]
[1,6,6,3]和[1,5,5,3]的图经过卷积得到了相同的大小,[1,3,3,1]
让我们再反过来看,那么[1,3,3,1]的图反卷积后得到什么呢?产生了两种情况。所以这里指定output_shape是有意义的,当然随意指定output_shape是不允许的,如下情况程序会报错:
y5 = tf.nn.conv2d_transpose(x1,kernel,output_shape=[1,10,10,3],strides=[1,2,2,1],padding="SAME")
以上是stride为2的情况,为1时也类似,当卷积核大于原图时,默认用VALID方式(用SAME就无意义了)参考下图:
程序清单:
import tensorflow as tf
x1 = tf.constant(1.0, shape=[1,3,3,1])
x2 = tf.constant(1.0, shape=[1,6,6,3])
x3 = tf.constant(1.0, shape=[1,5,5,3])
kernel = tf.constant(1.0, shape=[3,3,3,1])
y1 = tf.nn.conv2d_transpose(x1,kernel,output_shape=[1,6,6,3],
strides=[1,2,2,1],padding="SAME")
y2 = tf.nn.conv2d(x3, kernel, strides=[1,2,2,1], padding="SAME")
y3 = tf.nn.conv2d_transpose(y2,kernel,output_shape=[1,5,5,3],
strides=[1,2,2,1],padding="SAME")
y4 = tf.nn.conv2d(x2, kernel, strides=[1,2,2,1], padding="SAME")
'''
Wrong!!This is impossible
y5 = tf.nn.conv2d_transpose(x1,kernel,output_shape=[1,10,10,3],strides=[1,2,2,1],padding="SAME")
'''
sess = tf.Session()
tf.global_variables_initializer().run(session=sess)
x1_decov, x3_cov, y2_decov, x2_cov=sess.run([y1,y2,y3,y4])
print(x1_decov.shape)
print(x3_cov.shape)
print(y2_decov.shape)
print(x2_cov.shape)
来源:https://blog.csdn.net/mao_xiao_feng/article/details/71713358


猜你喜欢
- 使用VScode的用户代码片段功能,来生成自己习惯的代码模板,提升开发效率1.选择菜单里的 文件 > 首选项 > 用户代码片段2
- 1000块钱做个百度?能提出这种要求的客户实乃乙方克星、民族之光、科创永动机、西虹市一大杰出青年,诺奖永远得不到的人才。但作为一个硬核的程序
- 从前两天网上开始一直开着的chatgpt网页突然打不开了,提示1020错误,尝试换了不同代理软件或者代理地点仍然无法解决,也搜了很多资料,比
- Python是一门简单易学的编程语言。阅读好的Python程序感觉就像阅读英语,尽管是非常严格的英语。Python的这种伪代码特性是其最大强
- 运行以下代码: Dim com As ADODB.Command Dim rst
- 利用channel进行模拟令牌桶对访问进行限流func FW(max int,duration time.Duration){//定义一个c
- 1、存储过程基本语法: create procedure sp_name() begin ...... end; 2、如何调用: call
- 1、安装MSSQL时使用混合模式,当然SA密码最好不能为空,在SQL2005中,可以对SA这个超级用户名进行修改或删除。use master
- 前言之前实践了下face++在线人脸识别版本,这回做一下离线版本。github 上面有关于face_recognition的相关资料,本人只
- strConnString = "driver={MySQL ODBC 3.51 
- 近年,不论是正在快速增长的直播,远程教育以及IM聊天场景,还是在常规企业级系统中用到的系统提醒,对websocket的需求越来越大,对web
- 一、Python输出print是python输出的关键字,默认是输出内容后换行。如果不想换行,需要在变量末尾加上 end=&quo
- 1. 使用默认的session, 在ini文件中:from pyramid.session import UnencryptedCookie
- python爬取数据保存为Json格式代码如下:#encoding:'utf-8'import urllib.request
- 依赖库flask安装,使用豆瓣源加速。pip install flask -i https://pypi.douban.com/simple
- 网页得来,原网页广告太多,影响心情 <html> <head> <title>检查是否为URL</
- 前言Python 读取数据自动写入 MySQL 数据库,这个需求在工作中是非常普遍的,主要涉及到 python 操作数据库,读写更新等,数据
- 1 通过System.DBNull判断,网上大部分都使用这个方法。DataTable dt;
- python pandas分组聚合1、环境python3.9win10 64bitpandas==1.2.1groupby方法是pandas
- 目录一、socketserver实现并发二、验证客户端合法性一、socketserver实现并发tcp协议的socket是只能和一个客户端通