1赞

python按比例随机切分数据的实现

作者：sx-March23 | 2021-10-21 16:58

这篇文章主要介绍了python按比例随机切分数据的实现，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧

在机器学习或者深度学习中，我们常常碰到一个问题是数据集的切分。比如在一个比赛中，举办方给我们的只是一个带标注的训练集和不带标注的测试集。其中训练集是用于训练，而测试集用于已训练模型上跑出一个结果，然后提交，然后举办方验证结果给出一个分数。但是我们在训练过程中，可能会出现过拟合等问题，会面临着算法和模型的选择，此时，验证集就显得很重要。通常，如果数据量充足，我们会从训练集中划分出一定比例的数据来作为验证集。

每次划分数据集都手动写一个脚本，重复性太高，因此将此简单的脚本放到自己的博客。代码如下：

import random

def split(full_list,shuffle=False,ratio=0.2):
  n_total = len(full_list)
  offset = int(n_total * ratio)
  if n_total==0 or offset<1:
    return [],full_list
  if shuffle:
    random.shuffle(full_list)
  sublist_1 = full_list[:offset]
  sublist_2 = full_list[offset:]
  return sublist_1,sublist_2


if __name__ == "__main__":
  li = range(5)
  sublist_1,sublist_2 = split(li,shuffle=True,ratio=0.2)

  print sublist_1,len(sublist_1)
  print sublist_2,len(sublist_2)

其中，main为测试代码。假如训练集给出的是一个文件，我们先将文件读到列表中，然后再调用split。

以上就是本文的全部内容，希望对大家的学习有所帮助，也希望大家多多支持。

推荐阅读

程序员
REST API版本控制 - 为什么版本不是模型

如何解决《RESTAPI版本控制-为什么版本不是模型》经验，为你挑选了1个好方法。 ... [详细]
程序员
在联合中使用继承

如何解决《在联合中使用继承》经验，为你挑选了0个好方法。 ... [详细]
程序员
在OSX上使用CMake构建Unity本机包

如何解决《在OSX上使用CMake构建Unity本机包》经验，为你挑选了1个好方法。 ... [详细]
程序员
使用ShaderMaterial的自定义几何体的纹理加载在Three.js中不起作用

如何解决《使用ShaderMaterial的自定义几何体的纹理加载在Three.js中不起作用》经验，为你挑选了1个好方法。 ... [详细]
程序员
为什么这个调用swap()模棱两可？

如何解决《为什么这个调用swap()模棱两可？》经验，为你挑选了2个好方法。 ... [详细]
程序员
张量流显式设备要求错误

如何解决《张量流显式设备要求错误》经验，为你挑选了1个好方法。 ... [详细]
程序员
跟踪嵌入式Python解释器中的代码执行

如何解决《跟踪嵌入式Python解释器中的代码执行》经验，为你挑选了1个好方法。 ... [详细]
程序员
NUnit 3.0 TestCase const自定义对象参数

如何解决《NUnit3.0TestCaseconst自定义对象参数》经验，为你挑选了2个好方法。 ... [详细]
程序员
dplyr在mutate中每组播放单个值

如何解决《dplyr在mutate中每组播放单个值》经验，为你挑选了1个好方法。 ... [详细]
程序员
在RoR中有什么方法可以在路由中添加一些可选参数吗？

如何解决《在RoR中有什么方法可以在路由中添加一些可选参数吗？》经验，为你挑选了1个好方法。 ... [详细]
程序员
是否有可能在C#中编写没有变量的程序？

如何解决《是否有可能在C#中编写没有变量的程序？》经验，为你挑选了1个好方法。 ... [详细]
程序员
从项目中的核心数据开始？

如何解决《从项目中的核心数据开始？》经验，为你挑选了1个好方法。 ... [详细]
程序员
排序和匹配列表项

如何解决《排序和匹配列表项》经验，为你挑选了1个好方法。 ... [详细]
程序员
将原始14位二进制补码转换为有符号16位整数

如何解决《将原始14位二进制补码转换为有符号16位整数》经验，为你挑选了2个好方法。 ... [详细]
程序员
未捕获的TypeError：window.reload不是函数

如何解决《未捕获的TypeError：window.reload不是函数》经验，为你挑选了1个好方法。 ... [详细]
程序员
在Windows服务器上从bitbucket自动部署到iis

如何解决《在Windows服务器上从bitbucket自动部署到iis》经验，为你挑选了0个好方法。 ... [详细]
程序员
通过C中的数组迭代

如何解决《通过C中的数组迭代》经验，为你挑选了1个好方法。 ... [详细]
程序员
Jenkins Swarm插件-具有RANDOM字母数字值的从站名称

如何解决《JenkinsSwarm插件-具有RANDOM字母数字值的从站名称》经验，为你挑选了1个好方法。 ... [详细]
程序员
Python请求模块导入错误

如何解决《Python请求模块导入错误》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何在Babel 6中使用babel-runtime？

如何解决《如何在Babel6中使用babel-runtime？》经验，为你挑选了2个好方法。 ... [详细]

sx-March23

这个屌丝很懒，什么也没留下！

关注作者

Tags | 热门标签

RankList | 热门文章