mhtml图片提取 百度图片下载

2024-09-07 04:12

本文主要是介绍mhtml图片提取 百度图片下载,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

如果你需要找一些图片,可以先去百度一下,待相关网页加载完成后,点击保存,即可得到一个mhtml文件。这个文件里的图片会用base64进行存储,只需要找到他们并转化就可以。目前在美篇之类的网站上效果还一般,需要继续排查问题。

效果

提取图片

代码

大概分为提取所有base64、转化为图片两步。

import base64
from io import BytesIO
from PIL import Image
import os# 从文件中提取所有符合条件的 Base64 内容
def extract_all_contents(file_path):contents = []with open(file_path, 'r', encoding='utf-8') as file:content_found = Falsecontent = []for line in file:line = line.strip()  # 去除行末尾的换行符和空格if content_found:if not line:  # 如果遇到空行,表示content结束if content:  # 保存非空的 contentcontents.append("\n".join(content))content_found = Falsecontent = []  # 重置 contentelse:content.append(line)  # 将当前行加入 contentelif line.startswith("Content-Location:"):# 读取下一行,检查是否为空行next_line = next(file).strip()if not next_line:  # 如果下一行是空行,开始读取 content 部分content_found = Truereturn contents# 将 Base64 编码转换为图像
def base64_to_image(base64_string, output_image_path=None):try:# 解码 base64 字符串image_data = base64.b64decode(base64_string)# 将解码后的字节数据转换为图像image = Image.open(BytesIO(image_data))# 如果指定了输出路径,保存图像if output_image_path:image.save(output_image_path)# 返回图像对象以供进一步处理或显示return imageexcept (base64.binascii.Error, IOError):# 如果解码失败或不是有效的图像数据,返回 Nonereturn None# 综合使用两个函数处理文件
def process_large_file_for_images(file_path,save_path):# 提取所有符合条件的 Base64 内容all_contents = extract_all_contents(file_path)image_count = 0for index, content in enumerate(all_contents):print(f"处理第 {index + 1} 个内容...")# 尝试将提取的 Base64 内容转换为图像image = base64_to_image(content, f'output_image_{index + 1}.png')if image:# 如果成功生成图像,显示或进一步处理image_count += 1print(f"成功生成第 {index + 1} 个图像: output_image_{index + 1}.png")tmp_path=os.path.join(save_path,f" output_image_{index + 1}.png")image.save(tmp_path)else:print(f"第 {index + 1} 个内容无法转换为图像")if image_count == 0:print("未找到任何有效的图像内容")else:print(f"总共成功生成 {image_count} 个图像")# 使用示例
file_path = r'e:\data\网页下载\ccc.txt'  # 替换为实际的文件路径
save_path=r"e:\data\网页下载"
process_large_file_for_images(file_path,save_path)

这篇关于mhtml图片提取 百度图片下载的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1144024

相关文章

Python实现word文档内容智能提取以及合成

《Python实现word文档内容智能提取以及合成》这篇文章主要为大家详细介绍了如何使用Python实现从10个左右的docx文档中抽取内容,再调整语言风格后生成新的文档,感兴趣的小伙伴可以了解一下... 目录核心思路技术路径实现步骤阶段一:准备工作阶段二:内容提取 (python 脚本)阶段三:语言风格调

C#实现将Excel表格转换为图片(JPG/ PNG)

《C#实现将Excel表格转换为图片(JPG/PNG)》Excel表格可能会因为不同设备或字体缺失等问题,导致格式错乱或数据显示异常,转换为图片后,能确保数据的排版等保持一致,下面我们看看如何使用C... 目录通过C# 转换Excel工作表到图片通过C# 转换指定单元格区域到图片知识扩展C# 将 Excel

Vue3组件中getCurrentInstance()获取App实例,但是返回null的解决方案

《Vue3组件中getCurrentInstance()获取App实例,但是返回null的解决方案》:本文主要介绍Vue3组件中getCurrentInstance()获取App实例,但是返回nu... 目录vue3组件中getCurrentInstajavascriptnce()获取App实例,但是返回n

一文详解如何在Python中从字符串中提取部分内容

《一文详解如何在Python中从字符串中提取部分内容》:本文主要介绍如何在Python中从字符串中提取部分内容的相关资料,包括使用正则表达式、Pyparsing库、AST(抽象语法树)、字符串操作... 目录前言解决方案方法一:使用正则表达式方法二:使用 Pyparsing方法三:使用 AST方法四:使用字

JS+HTML实现在线图片水印添加工具

《JS+HTML实现在线图片水印添加工具》在社交媒体和内容创作日益频繁的今天,如何保护原创内容、展示品牌身份成了一个不得不面对的问题,本文将实现一个完全基于HTML+CSS构建的现代化图片水印在线工具... 目录概述功能亮点使用方法技术解析延伸思考运行效果项目源码下载总结概述在社交媒体和内容创作日益频繁的

前端CSS Grid 布局示例详解

《前端CSSGrid布局示例详解》CSSGrid是一种二维布局系统,可以同时控制行和列,相比Flex(一维布局),更适合用在整体页面布局或复杂模块结构中,:本文主要介绍前端CSSGri... 目录css Grid 布局详解(通俗易懂版)一、概述二、基础概念三、创建 Grid 容器四、定义网格行和列五、设置行

前端下载文件时如何后端返回的文件流一些常见方法

《前端下载文件时如何后端返回的文件流一些常见方法》:本文主要介绍前端下载文件时如何后端返回的文件流一些常见方法,包括使用Blob和URL.createObjectURL创建下载链接,以及处理带有C... 目录1. 使用 Blob 和 URL.createObjectURL 创建下载链接例子:使用 Blob

使用Node.js制作图片上传服务的详细教程

《使用Node.js制作图片上传服务的详细教程》在现代Web应用开发中,图片上传是一项常见且重要的功能,借助Node.js强大的生态系统,我们可以轻松搭建高效的图片上传服务,本文将深入探讨如何使用No... 目录准备工作搭建 Express 服务器配置 multer 进行图片上传处理图片上传请求完整代码示例

Vuex Actions多参数传递的解决方案

《VuexActions多参数传递的解决方案》在Vuex中,actions的设计默认只支持单个参数传递,这有时会限制我们的使用场景,下面我将详细介绍几种处理多参数传递的解决方案,从基础到高级,... 目录一、对象封装法(推荐)二、参数解构法三、柯里化函数法四、Payload 工厂函数五、TypeScript

基于Python实现高效PPT转图片工具

《基于Python实现高效PPT转图片工具》在日常工作中,PPT是我们常用的演示工具,但有时候我们需要将PPT的内容提取为图片格式以便于展示或保存,所以本文将用Python实现PPT转PNG工具,希望... 目录1. 概述2. 功能使用2.1 安装依赖2.2 使用步骤2.3 代码实现2.4 GUI界面3.效