记一次多线程写入文件出现IOException:Stream Closed的问题

2024-03-12 18:28

本文主要是介绍记一次多线程写入文件出现IOException:Stream Closed的问题,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

背景

        网关在解析1000个05文件(txt)写入到SFTP文件时,是每次读取1000 * 5条数据,然后每1000笔数据创建一个线程逐条数据进行字段数值映射转换,一共创建5个线程扔到线程池进行处理。每条数据解析完都会将数据写入到SFTP的DAT文件,并且累加条数写入到CTL文件。

原来是1000笔数据才进行解析,每个文件造数据10条,导入没问题。为了方便测试,把条数调小到每次读取5 * 2 条数据,每个文件有10条数据,方便验证多线程读取有无问题。

问题来了:预期是DAT文件会写入10笔数据,CTL文件记录的条数增加10,但是每次解析写到几条就抛异常了:IOException:Stream Closed,有时候能写2条,有时候能写4条,有时候能写8条.......

分析

  • 怀疑是不是因为改了网关的代码导致的,因为原来代码写死的1000,导入是没问题的,分析一波发现,原来每个文件只有10条数据,达不到1000,所以每次导入只会创建一个线程就处理完了,回检了一遍代码应该不是调小引发的问题;
  • 改成每次只读取5 * 2条,一次读取就把文件10条数据读完了,但是还是出现报错;改成每次只读取1 * 2条数据,要读取10 / 2 = 5次,才能读完,也还是会报错;
  • 是不是数据有问题呢?应该也不是,因为在配置1000的时候是能够把这10条数据正常写入的,打了断点也没发现write的时候写入的数据有啥问题 为什么会出现有时候能够写入2条就挂了,有时候写到4条呢.....发现是由于debug断点打的位置导致多个线程执行的快慢不一致导致的,如果不是debug的话正常postman触发是每次写了2条就报错了。补充一下:读取到数据并不是马上就写入到文件中,而是将数据加到一个dataList中存放,达到1000笔才写入;还有一个写入时机,那就是执行完每个线程会调用flush()方法,将dataList中的数据写入到txt
  • 原来每个线程处理完只返回boolean,主线程使用Future<Boolean>接收,看不到具体报错信息,在线程run()里面加了日志打印,也只能看到catch中的stream closed异常,看不到其他什么有效信息......
  • 试试其他思路:百度了一下Stream Closed这个报错原因,如果一个文件流对象已经关闭过了在finally再重复关闭一次的话会报这个错,由此猜测是不是因为我在write的时候文件流对象就被关闭了呢? debug断点打在写入前文件流对象那里,发现抛异常之前这个文件流对象一直都是正常的不为null,那为啥写入的时候会抛stream closed异常呢(有个误区:我一直以为closed了对象就会为null,后面才发现只是关闭只是跟句柄断开联系对象还不是null的)
  • 为啥其他文件的导入也是调用的ConvertIn这个通用的文件解析没有问题,我调用这个就有问题了呢。查看了一下其他文件的导入代码,发现其他文件的导入每次读取完1000条数据之后,并不是写入到文件,而是调用了作业条进行发送就返回了,不存在我这种写入文件的场景,自然就不会出现stream Closed的问题
  • 我这种场景跟导出的时候ConvertOut类似,读取文件数据之后再写入到txt中,对比了一个多线程里面的run()方法,发现我每次处理完一批数据就调用数据源的close()方法对文件流对象进行释放了,而导出的ConvertOut的话里面并没有closed文件对象,而是在处理完所有数据在finally才关闭文件流对象。每次创建线程的时候都将这个文件流对象传进去,导致有些线程在执行的时候将这个对象close了,其他线程在写的时候发现已经被关闭了,所以就报Stream Closed异常了
  • 至此,终于发现问题所在了,修改一下代码每个线程处理完不马上关闭这个文件流对象,而是在主线程外面的finally统一关闭一次,这样就不会出现多线程写入的时候报Stream Closed异常了

结论

  1. 调用别人的代码要认真阅读每行的逻辑,仔细斟酌有没有什么问题,是否适用,不能看都没看就放心使用,不然出了问题也不知道是什么原因.......
  2. 多线程进行文件写入时要注意及时关闭IO流对象防止内存泄漏

这篇关于记一次多线程写入文件出现IOException:Stream Closed的问题的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/802178

相关文章

MybatisGenerator文件生成不出对应文件的问题

《MybatisGenerator文件生成不出对应文件的问题》本文介绍了使用MybatisGenerator生成文件时遇到的问题及解决方法,主要步骤包括检查目标表是否存在、是否能连接到数据库、配置生成... 目录MyBATisGenerator 文件生成不出对应文件先在项目结构里引入“targetProje

C#使用HttpClient进行Post请求出现超时问题的解决及优化

《C#使用HttpClient进行Post请求出现超时问题的解决及优化》最近我的控制台程序发现有时候总是出现请求超时等问题,通常好几分钟最多只有3-4个请求,在使用apipost发现并发10个5分钟也... 目录优化结论单例HttpClient连接池耗尽和并发并发异步最终优化后优化结论我直接上优化结论吧,

Java内存泄漏问题的排查、优化与最佳实践

《Java内存泄漏问题的排查、优化与最佳实践》在Java开发中,内存泄漏是一个常见且令人头疼的问题,内存泄漏指的是程序在运行过程中,已经不再使用的对象没有被及时释放,从而导致内存占用不断增加,最终... 目录引言1. 什么是内存泄漏?常见的内存泄漏情况2. 如何排查 Java 中的内存泄漏?2.1 使用 J

numpy求解线性代数相关问题

《numpy求解线性代数相关问题》本文主要介绍了numpy求解线性代数相关问题,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一起学习学习吧... 在numpy中有numpy.array类型和numpy.mat类型,前者是数组类型,后者是矩阵类型。数组

解决systemctl reload nginx重启Nginx服务报错:Job for nginx.service invalid问题

《解决systemctlreloadnginx重启Nginx服务报错:Jobfornginx.serviceinvalid问题》文章描述了通过`systemctlstatusnginx.se... 目录systemctl reload nginx重启Nginx服务报错:Job for nginx.javas

Redis缓存问题与缓存更新机制详解

《Redis缓存问题与缓存更新机制详解》本文主要介绍了缓存问题及其解决方案,包括缓存穿透、缓存击穿、缓存雪崩等问题的成因以及相应的预防和解决方法,同时,还详细探讨了缓存更新机制,包括不同情况下的缓存更... 目录一、缓存问题1.1 缓存穿透1.1.1 问题来源1.1.2 解决方案1.2 缓存击穿1.2.1

java Stream操作转换方法

《javaStream操作转换方法》文章总结了Java8中流(Stream)API的多种常用方法,包括创建流、过滤、遍历、分组、排序、去重、查找、匹配、转换、归约、打印日志、最大最小值、统计、连接、... 目录流创建1、list 转 map2、filter()过滤3、foreach遍历4、groupingB

vue解决子组件样式覆盖问题scoped deep

《vue解决子组件样式覆盖问题scopeddeep》文章主要介绍了在Vue项目中处理全局样式和局部样式的方法,包括使用scoped属性和深度选择器(/deep/)来覆盖子组件的样式,作者建议所有组件... 目录前言scoped分析deep分析使用总结所有组件必须加scoped父组件覆盖子组件使用deep前言

解决Cron定时任务中Pytest脚本无法发送邮件的问题

《解决Cron定时任务中Pytest脚本无法发送邮件的问题》文章探讨解决在Cron定时任务中运行Pytest脚本时邮件发送失败的问题,先优化环境变量,再检查Pytest邮件配置,接着配置文件确保SMT... 目录引言1. 环境变量优化:确保Cron任务可以正确执行解决方案:1.1. 创建一个脚本1.2. 修

Python 标准库time时间的访问和转换问题小结

《Python标准库time时间的访问和转换问题小结》time模块为Python提供了处理时间和日期的多种功能,适用于多种与时间相关的场景,包括获取当前时间、格式化时间、暂停程序执行、计算程序运行时... 目录模块介绍使用场景主要类主要函数 - time()- sleep()- localtime()- g