python 解决data imbalance问题(以casia-webface为例)

2023-10-06 22:20

本文主要是介绍python 解决data imbalance问题(以casia-webface为例),希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

Method for Data Imbalance

对于分部不均的数据集使用,从而避免long tail distribution。例如CASIA-WebFace
Alt

import os
import randomdef list_of_groups(init_list, children_list_len):""":param init_list: (list) 放想要分割的list:param children_list_len: (list)  想要分割成几份:return:"""list_of_groups = zip (*(iter (init_list),) * children_list_len)end_list = [list (i) for i in list_of_groups]count = len (init_list) % children_list_lenend_list.append (init_list[-count:]) if count != 0 else end_listreturn end_listdef dataset_split(dataset_path, batch_size, select_num):""":param dataset_path: (str)存放子文件夹的目录:param batch_size: (int)同训练时的batch size:param select_num: (int)每个文件夹选择的图片个数:return: (list)整个数据集处理后的文件路径,list中还有list"""img_name = []  # 文件夹名img_num = []  # 文件夹所含图片个数train_path_list = []for folders in os.listdir (dataset_path):img_name.append (folders)img_folder = os.path.join (dataset_path, folders)img_num.append (len (os.listdir (img_folder)))img_name_sep = list_of_groups (img_name, int (batch_size / select_num))for combined_img_folders in img_name_sep:for single_img_folder in combined_img_folders:img_folder_path = os.path.join (dataset_path, single_img_folder)img_folder_imgs = os.listdir (img_folder_path)if len (img_folder_imgs) > select_num:select_img = random.sample (img_folder_imgs, select_num)path = [img_folder_path + '/' + i for i in select_img]train_path_list.append (path)else:print ('Folder {} failed to fetch'.format (single_img_folder))return (train_path_list)if __name__ == '__main__':casia_folder = r'E:/FaceNet-pytorch/facenet-pytorch--main/datasets/'train_path = dataset_split (dataset_path=casia_folder,batch_size=32,select_num=8)print(train_path[0])

在这里插入图片描述

这篇关于python 解决data imbalance问题(以casia-webface为例)的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/154248

相关文章

SQL Server配置管理器无法打开的四种解决方法

《SQLServer配置管理器无法打开的四种解决方法》本文总结了SQLServer配置管理器无法打开的四种解决方法,文中通过图文示例介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的... 目录方法一:桌面图标进入方法二:运行窗口进入检查版本号对照表php方法三:查找文件路径方法四:检查 S

Python中你不知道的gzip高级用法分享

《Python中你不知道的gzip高级用法分享》在当今大数据时代,数据存储和传输成本已成为每个开发者必须考虑的问题,Python内置的gzip模块提供了一种简单高效的解决方案,下面小编就来和大家详细讲... 目录前言:为什么数据压缩如此重要1. gzip 模块基础介绍2. 基本压缩与解压缩操作2.1 压缩文

Python设置Cookie永不超时的详细指南

《Python设置Cookie永不超时的详细指南》Cookie是一种存储在用户浏览器中的小型数据片段,用于记录用户的登录状态、偏好设置等信息,下面小编就来和大家详细讲讲Python如何设置Cookie... 目录一、Cookie的作用与重要性二、Cookie过期的原因三、实现Cookie永不超时的方法(一)

Python内置函数之classmethod函数使用详解

《Python内置函数之classmethod函数使用详解》:本文主要介绍Python内置函数之classmethod函数使用方式,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地... 目录1. 类方法定义与基本语法2. 类方法 vs 实例方法 vs 静态方法3. 核心特性与用法(1编程客

Python函数作用域示例详解

《Python函数作用域示例详解》本文介绍了Python中的LEGB作用域规则,详细解析了变量查找的四个层级,通过具体代码示例,展示了各层级的变量访问规则和特性,对python函数作用域相关知识感兴趣... 目录一、LEGB 规则二、作用域实例2.1 局部作用域(Local)2.2 闭包作用域(Enclos

怎样通过分析GC日志来定位Java进程的内存问题

《怎样通过分析GC日志来定位Java进程的内存问题》:本文主要介绍怎样通过分析GC日志来定位Java进程的内存问题,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录一、GC 日志基础配置1. 启用详细 GC 日志2. 不同收集器的日志格式二、关键指标与分析维度1.

Python实现对阿里云OSS对象存储的操作详解

《Python实现对阿里云OSS对象存储的操作详解》这篇文章主要为大家详细介绍了Python实现对阿里云OSS对象存储的操作相关知识,包括连接,上传,下载,列举等功能,感兴趣的小伙伴可以了解下... 目录一、直接使用代码二、详细使用1. 环境准备2. 初始化配置3. bucket配置创建4. 文件上传到os

Java 线程安全与 volatile与单例模式问题及解决方案

《Java线程安全与volatile与单例模式问题及解决方案》文章主要讲解线程安全问题的五个成因(调度随机、变量修改、非原子操作、内存可见性、指令重排序)及解决方案,强调使用volatile关键字... 目录什么是线程安全线程安全问题的产生与解决方案线程的调度是随机的多个线程对同一个变量进行修改线程的修改操

使用Python实现可恢复式多线程下载器

《使用Python实现可恢复式多线程下载器》在数字时代,大文件下载已成为日常操作,本文将手把手教你用Python打造专业级下载器,实现断点续传,多线程加速,速度限制等功能,感兴趣的小伙伴可以了解下... 目录一、智能续传:从崩溃边缘抢救进度二、多线程加速:榨干网络带宽三、速度控制:做网络的好邻居四、终端交互

Python中注释使用方法举例详解

《Python中注释使用方法举例详解》在Python编程语言中注释是必不可少的一部分,它有助于提高代码的可读性和维护性,:本文主要介绍Python中注释使用方法的相关资料,需要的朋友可以参考下... 目录一、前言二、什么是注释?示例:三、单行注释语法:以 China编程# 开头,后面的内容为注释内容示例:示例:四