【爬虫】巧用 js2py (附带bug解决)

2023-11-05 06:18

本文主要是介绍【爬虫】巧用 js2py (附带bug解决),希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

项目地址: https://github.com/PiotrDabkowski/Js2Py

项目介绍:(根据github)此项目完全用Python编写,支持Python2/3。可以在Python中执行JS代码,并获取JS对象值。

目前支持ES5,ES6仍在测试中。

一句话解释:一个纯Python的JS解释器。

推荐指数:四颗星  (博主用过其他的库如execjs, pyv8,多多少少都没有这个库的功能完备)

安装:pip3 install js2py

 

本文主要介绍js2py的EvalJs对象,因为它是功能最完备的。

1. 执行简单的JS代码

import js2py
js = """a =1 b =1function f(x){return x*x}"""
ctx = js2py.EvalJs()  # 初始化context对象
ctx.execute(js)  # 执行js
print(ctx.a)  # >>1   获取js变量
print(ctx.f(9))  # >>81  执行js函数

说明:EvalJs对象支持在同一个上下文中执行多次多段js代码,并能通过属性的方式获取js变量,非常好用。

2. Python与JS对象交互

import js2py
js = """function f(arg1, arg2){return arg1+arg2}end = f(a,b)"""
ctx = js2py.EvalJs(context={'a':1, 'b':2})  # 初始化context对象,通过字典形式传入python对象与js交互
ctx.execute(js)  # 执行js
print(ctx.end)  # 3

3. 在JS代码中引入外部JS库(需要安装nodejs环境)

import js2py
js = """var path = require('path')p=path.join('/foo/bar', 'file')"""
ctx = js2py.EvalJs(enable_require=True)  # 开启require功能
ctx.execute(js)  # 执行js
print(ctx.p)  # /foo/bar/file
js = """p = p+p"""
ctx.execute(js)  # 执行js
print(ctx.p)  # /foo/bar/file/foo/bar/file

关于require在js2py中使用有个bug,会在最后说明。

4. Python与JS混编

CryptoJS = js2py.require('crypto-js')
data = [{'id':1}, {'id':2}]
JSON = js2py.eval_js('JSON')ciphertext = CryptoJS.AES.encrypt(JSON.stringify(data), 'secret key 123')
bytes = CryptoJS.AES.decrypt(ciphertext.toString(), 'secret key 123')
decryptedData = JSON.parse(bytes.toString(CryptoJS.enc.Utf8)).to_list()print(decryptedData)  # [{'id':1}, {'id':2}]

5. 最后

在对js2py这个库的摸索使用中,发现了不少的问题(bug),发现作者最后一次处理issue是在2018年11月了,超过20个issue未处理,博主也把遇到的问题提了两个上去,不知道能不能收到回复。

博主修复的bug:在windows 10 上使用这个库执行带有require语句的JS代码时遇到的错误

Could not link required node_modules

解决:经过反复测试与检查,发现是subprocess库在windows上执行shell命令有bug。具体是这样,在Python包安装路径下的js2py/node_import.py的17行有以下代码:

assert subprocess.call('cd %s;npm install babel-core babel-cli babel-preset-es2015 babel-polyfill babelify browserify browserify-shim'% repr(DIRNAME),shell=True,cwd=DIRNAME) == 0, 'Could not link required node_modules'

这句代码时在windows上安装js依赖包,在cmd下执行时没有问题的,但是通过subprocess执行就有问题,问题在于subprocess不能正确执行带分号的命令,这就导致在执行require JS语句时一直报这个错,但我估计在linux环境是没有问题的。

修改

assert subprocess.call('npm install babel-core babel-cli babel-preset-es2015 babel-polyfill babelify browserify browserify-shim',shell=True,cwd=DIRNAME) == 0, 'Could not link required node_modules'

其实这里作者的cd命令是多余的,因为cwd参数已经指定了命令的执行路径,无需再cd进入路径。

除了这里,还要修改这个文件第79行,一样的问题。

最后友情提醒,如果你的环境不能科学上网,你最好修改一下npm的源:

 npm config set registry https://registry.npm.taobao.org

避免网络问题导致不必要的麻烦,因为执行的JS代码依赖外部库时,这个库会在后台执行npm install操作(仅一次)。

其他:

因为博主也是搞爬虫的,所有有时会用到这样的库,这次就做一下完整的记录,助己助人。

本博客欢迎留言 :) 

这篇关于【爬虫】巧用 js2py (附带bug解决)的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/347975

相关文章

Java循环创建对象内存溢出的解决方法

《Java循环创建对象内存溢出的解决方法》在Java中,如果在循环中不当地创建大量对象而不及时释放内存,很容易导致内存溢出(OutOfMemoryError),所以本文给大家介绍了Java循环创建对象... 目录问题1. 解决方案2. 示例代码2.1 原始版本(可能导致内存溢出)2.2 修改后的版本问题在

大数据小内存排序问题如何巧妙解决

《大数据小内存排序问题如何巧妙解决》文章介绍了大数据小内存排序的三种方法:数据库排序、分治法和位图法,数据库排序简单但速度慢,对设备要求高;分治法高效但实现复杂;位图法可读性差,但存储空间受限... 目录三种方法:方法概要数据库排序(http://www.chinasem.cn对数据库设备要求较高)分治法(常

Vue项目中Element UI组件未注册的问题原因及解决方法

《Vue项目中ElementUI组件未注册的问题原因及解决方法》在Vue项目中使用ElementUI组件库时,开发者可能会遇到一些常见问题,例如组件未正确注册导致的警告或错误,本文将详细探讨这些问题... 目录引言一、问题背景1.1 错误信息分析1.2 问题原因二、解决方法2.1 全局引入 Element

linux报错INFO:task xxxxxx:634 blocked for more than 120 seconds.三种解决方式

《linux报错INFO:taskxxxxxx:634blockedformorethan120seconds.三种解决方式》文章描述了一个Linux最小系统运行时出现的“hung_ta... 目录1.问题描述2.解决办法2.1 缩小文件系统缓存大小2.2 修改系统IO调度策略2.3 取消120秒时间限制3

C#使用HttpClient进行Post请求出现超时问题的解决及优化

《C#使用HttpClient进行Post请求出现超时问题的解决及优化》最近我的控制台程序发现有时候总是出现请求超时等问题,通常好几分钟最多只有3-4个请求,在使用apipost发现并发10个5分钟也... 目录优化结论单例HttpClient连接池耗尽和并发并发异步最终优化后优化结论我直接上优化结论吧,

解决systemctl reload nginx重启Nginx服务报错:Job for nginx.service invalid问题

《解决systemctlreloadnginx重启Nginx服务报错:Jobfornginx.serviceinvalid问题》文章描述了通过`systemctlstatusnginx.se... 目录systemctl reload nginx重启Nginx服务报错:Job for nginx.javas

Mysql DATETIME 毫秒坑的解决

《MysqlDATETIME毫秒坑的解决》本文主要介绍了MysqlDATETIME毫秒坑的解决,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着... 今天写代码突发一个诡异的 bug,代码逻辑大概如下。1. 新增退款单记录boolean save = s

vue解决子组件样式覆盖问题scoped deep

《vue解决子组件样式覆盖问题scopeddeep》文章主要介绍了在Vue项目中处理全局样式和局部样式的方法,包括使用scoped属性和深度选择器(/deep/)来覆盖子组件的样式,作者建议所有组件... 目录前言scoped分析deep分析使用总结所有组件必须加scoped父组件覆盖子组件使用deep前言

解决Cron定时任务中Pytest脚本无法发送邮件的问题

《解决Cron定时任务中Pytest脚本无法发送邮件的问题》文章探讨解决在Cron定时任务中运行Pytest脚本时邮件发送失败的问题,先优化环境变量,再检查Pytest邮件配置,接着配置文件确保SMT... 目录引言1. 环境变量优化:确保Cron任务可以正确执行解决方案:1.1. 创建一个脚本1.2. 修

Mysql8.0修改配置文件my.ini的坑及解决

《Mysql8.0修改配置文件my.ini的坑及解决》使用记事本直接编辑my.ini文件保存后,可能会导致MySQL无法启动,因为MySQL会以ANSI编码读取该文件,解决方法是使用Notepad++... 目录Myhttp://www.chinasem.cnsql8.0修改配置文件my.ini的坑出现的问题