位置：首页>> 网络编程>> Python编程>> python按比例随机切分数据的实现

python按比例随机切分数据的实现

作者：HOU_JUN　　发布时间：2021-05-28 05:17:34　

标签：python,随机,切分

在机器学习或者深度学习中，我们常常碰到一个问题是数据集的切分。比如在一个比赛中，举办方给我们的只是一个带标注的训练集和不带标注的测试集。其中训练集是用于训练，而测试集用于已训练模型上跑出一个结果，然后提交，然后举办方验证结果给出一个分数。但是我们在训练过程中，可能会出现过拟合等问题，会面临着算法和模型的选择，此时，验证集就显得很重要。通常，如果数据量充足，我们会从训练集中划分出一定比例的数据来作为验证集。

每次划分数据集都手动写一个脚本，重复性太高，因此将此简单的脚本放到自己的博客。代码如下：

import random

def split(full_list,shuffle=False,ratio=0.2):
n_total = len(full_list)
offset = int(n_total * ratio)
if n_total==0 or offset<1:
return [],full_list
if shuffle:
random.shuffle(full_list)
sublist_1 = full_list[:offset]
sublist_2 = full_list[offset:]
return sublist_1,sublist_2

if __name__ == "__main__":
li = range(5)
sublist_1,sublist_2 = split(li,shuffle=True,ratio=0.2)

print sublist_1,len(sublist_1)
print sublist_2,len(sublist_2)

其中，main为测试代码。假如训练集给出的是一个文件，我们先将文件读到列表中，然后再调用split。

来源：https://www.cnblogs.com/houjun/p/9766781.html

0

投稿

猜你喜欢

python使用pandas按照行数分割表格
目录问题思路代码实现测试效果问题一张excel表格，大概1万行，需要录入系统系统每次最多只能录入500行表格数据，一旦超过500行，就会录入
Firefox插件推荐：CSS Usage
css usage是一个基于firebug的firefox扩展，可以用来查看页面中的CSS的使用情况，可以清楚的查看css文件中所有的规则在
Python中for后接else的语法使用
0、背景今天看到了一个比较诡异的写法，for后直接跟了else语句，起初还以为是没有缩进好，查询后发现果然有这种语法，特此分享。之前写过c+
windows下Python安装、使用教程和Notepad++的使用教程
一、Python下载1.进入Python官网：https://www.python.org/2.选择windows版本（Download &
apache集成php7.3.5的详细步骤
安装 php首先安装 php 的压缩包，目前下载地址解压文件到这个路径下：D:\Program Files\php-7.3.5(自行选择合适
cmd运行python文件时对结果进行保存的方法
当用cmd命令行运行python文件时，我们知道可以通过>python pyfile.py来运行python文件，此时的输出会直接打印
layui table 获取分页 limit的方法
如下所示：var table_name = table.render({});page_size = table_name.config.l
python自动化测试之从命令行运行测试用例with verbosity
本文实例讲述了python自动化测试之从命令行运行测试用例with verbosity，分享给大家供大家参考。具体如下：实例文件recipe
分享十个Python超级好用提高工作效率的自动化脚本
重复性任务总是耗时且无聊，想一想你想要一张一张地裁剪 100 张照片或 Fetch API、纠正拼写和语法等工作，所有这些任务都很耗时，为什
php函数serialize()与unserialize()用法实例
本文实例讲述了php函数serialize()与unserialize()用法。分享给大家供大家参考。具体方法如下：该实例主要讲述了php函
Python enumerate()计数器简化循环
目录一、for在 Python 中使用循环进行迭代二、使用 Python 的 enumerate()三、用 Python 练习 enumer
如何用Python破解wifi密码过程详解
前言Python真的是无所不能，原因就是因为Python有数目庞大的库，无数的现成的轮子，让你做很多很多应用都非常方便。wifi跟我们的生活
Python使用lambda表达式对字典排序操作示例
本文实例讲述了Python使用lambda表达式对字典排序操作。分享给大家供大家参考，具体如下：lambda表达式也常用于字典排序，既然写到
python使用递归解决全排列数字示例
第一种方法：递归def perms(elements): if len(elements) <=1
三分钟掌握PHP操作数据库
一、操作数据库（mysql）的工具1.1命令行工具1.2navicat界面化工具1.3phpAdmin界面化工具一般情况下安装phpstu
ORACLE客户端连接服务器的注意事项
本文介绍了ORACLE客户端连服务器的注意事项：1. 通过SQL*NET协议，ORACLE客户端连服务器时一般需要配置sqlnet.ora和
清除浮动的最简写法
元素浮动导致的问题及解决办法大家都应该很熟悉了，举个简单的例子：<style type="text/css">
教你用Python读取CSV文件的5种方式
在python里面，读取或写入csv文件时，首先要import csv这个库，然后利用这个库提供的方法进行对文件的读写。典型的数据集stoc
Python定义函数实现累计求和操作
一、使用三种方法实现0-n累加求和定义函数分别使用while循环、for循环、递归函数实现对0-n的累加求和1、使用while循环定义一个累
浅析SQL Server与Oracle数据库的区别
随着信息技术的飞速发展，数据处理不仅在数量上要求越来越大，而且在质量上也要求越来越高。操作系统的稳定对数据库来说是十分紧要的，在数据库可操作

Python机器学习性能度量利用鸢尾花数据绘制P-R曲线

为Python的Tornado框架配置使用Jinja2模板引擎的方法

python中的list字符串元素排序

Python实现计算函数或程序执行时间

一文详解如何使用Python批量拼接图片

Python中栈、队列与优先级队列的实现方法

Pytorch反向求导更新网络参数的方法

Python3.5内置模块之time与datetime模块用法实例分析

Python flask框架端口失效解决方案

python 绘制拟合曲线并加指定点标识的实现

arctime怎么添加双语字幕？arctime双语字幕教程

Python中的字符串操作和编码Unicode详解

WPS轻松办公—如何制作九宫格图片

iOS 11中如何取消人像模式的景深效果

在ASP中使用SQL语句之9:表单操作

英伟达显卡527.56驱动发布！为门户RTX和巫师3下一代更新带来优化！

WPS 如何将 word 里的文字一键变整齐

win10更新补丁KB5014699没有卸载按钮？Win10 KB5014699卸载方法

Win10电脑玩游戏FPS值过低怎么办？小编教你快速利用Windows功能提高FPS

教你如何让WPS演示播放时无声，便于自己讲解配音

手机版 网络编程 asp之家 www.aspxhome.com