Kaggle(Gun Violence Data)—美国枪支暴力事件分析(2)

2023-11-21 15:40

本文主要是介绍Kaggle(Gun Violence Data)—美国枪支暴力事件分析(2),希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

继上次分析之后,这次打算用详细的时间序列算法预测,我们使用ARMA时间序列模型作为预测,选取17年数据和18年1月和2月数据作为训练,预测18年3月1日,3月2日及3月3日数据。

话不多说,直接整吧。

1.基本数据整理

#-*- coding: utf-8 -*-
#arima时序模型import pandas as pd
#时序图
import matplotlib.pyplot as plt
from plotly.offline import init_notebook_mode, iplot,plot
init_notebook_mode(connected=True)
import plotly.graph_objs as godf=pd.read_csv('gun-violence-data_01-2013_03-2018.csv')
df=df[['date','n_killed']]
df.to_csv('data_nkilled.csv')

2.选取所需数据

discfile = 'data_nkilled.csv'
forecastnum = 5#读取数据,指定日期列为指标,Pandas自动将“日期”列识别为Datetime格式
data = pd.read_csv(discfile)
data=data.iloc[:,1:]#处理数据,只需要2018年的数据
data17=data[data['date'].astype('datetime64').dt.year==2017 ]
data18=data[data['date'].astype('datetime64').dt.year==2018 ]
data2=data18[data18['date'].astype('datetime64').dt.month<=2]
#data3=data[data['date'].astype('datetime64').dt.month==3]
#data3=data3[data3['date'].astype('datetime64').dt.day>15]
mydata=pd.DataFrame()
mydata=mydata.append(data17)
mydata=mydata.append(data2)
#mydata=data
#mydata.head()temp=mydata.groupby('date').agg({'n_killed' : 'sum'})
#temp.head()

选取17年数据和18年1月和2月数据作为训练

显示真实的时间序列

trace1=go.Bar(x=temp.index,y=temp['n_killed'])
data = [trace1]
layout =dict(height=400, title='2017-2018年被杀人数统计', legend=dict(orientation="h"));
fig = go.Figure(data=data, layout=layout)
iplot(fig)

这里写图片描述
上图为已有真实数据的分布

3.自相关图及检验

自相关图

#自相关图
from statsmodels.graphics.tsaplots import plot_acf
plot_acf(temp)
plt.show()

这里写图片描述
上图为自相关性检验图,上图展示了明显的1阶拖尾效应,可以初步的判断序列不存在自相关性。

ADF检验

#平稳性检测
from statsmodels.tsa.stattools import adfuller as ADF
print(u'原始序列的ADF检验结果为:', ADF(temp['n_killed']))

原始序列的ADF检验结果为:
(-3.0443905852697957,
0.03095172945803373,
14,
408,
{‘1%’: -3.446479704252724,
‘5%’: -2.8686500930967354,
‘10%’: -2.5705574627547096},
2874.7803552969235)

ADF检验结果显示p=0.03<0.05,说明不存在显著自相关性

偏自相关图

from statsmodels.graphics.tsaplots import plot_pacf
plot_pacf(temp)
plt.show() #偏自相关图

这里写图片描述

由图中可明显看出该序列的偏自相关图有明显1阶拖尾效应。

白噪声检验

#白噪声检验
from statsmodels.stats.diagnostic import acorr_ljungbox
print(u'差分序列的白噪声检验结果为:', acorr_ljungbox(temp, lags=1)) #返回统计量和p值

序列的白噪声检验结果为: (array([8.36275837]), array([0.00382989]))

可见,p值远小于0.05,说明该序列为平稳的非白噪声检验,有进一步预测的必要和依据。

4.预测

由该序列的自相关图和偏自相关图都为1阶,且是平稳的非白噪声序列可以确定使用ARMA模型,且模型参数p=1,q=1.

from statsmodels.tsa.arima_model import ARMA
temp=temp.astype(float)
model = ARMA(temp, (1,1,1)).fit() #建立ARIMA(0, 1, 1)模型
model.summary2() #给出一份模型报告
model.forecast(3) #作为期5天的预测,返回预测结果、标准误差、置信区间。

这里写图片描述

可见真实值都落在了置信区间(5%)以内,可以推断我们预测的因枪击事件死亡的人数存在合理性,但枪击还是属于突发性不确定性事件,随着时间的推移,预测准确性会明显下滑。

github项目地址:
https://github.com/LIANGQINGYUAN/GunViolence_DataMining

欢迎各位看官star~

这篇关于Kaggle(Gun Violence Data)—美国枪支暴力事件分析(2)的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/403305

相关文章

性能分析之MySQL索引实战案例

文章目录 一、前言二、准备三、MySQL索引优化四、MySQL 索引知识回顾五、总结 一、前言 在上一讲性能工具之 JProfiler 简单登录案例分析实战中已经发现SQL没有建立索引问题,本文将一起从代码层去分析为什么没有建立索引? 开源ERP项目地址:https://gitee.com/jishenghua/JSH_ERP 二、准备 打开IDEA找到登录请求资源路径位置

SWAP作物生长模型安装教程、数据制备、敏感性分析、气候变化影响、R模型敏感性分析与贝叶斯优化、Fortran源代码分析、气候数据降尺度与变化影响分析

查看原文>>>全流程SWAP农业模型数据制备、敏感性分析及气候变化影响实践技术应用 SWAP模型是由荷兰瓦赫宁根大学开发的先进农作物模型,它综合考虑了土壤-水分-大气以及植被间的相互作用;是一种描述作物生长过程的一种机理性作物生长模型。它不但运用Richard方程,使其能够精确的模拟土壤中水分的运动,而且耦合了WOFOST作物模型使作物的生长描述更为科学。 本文让更多的科研人员和农业工作者

MOLE 2.5 分析分子通道和孔隙

软件介绍 生物大分子通道和孔隙在生物学中发挥着重要作用,例如在分子识别和酶底物特异性方面。 我们介绍了一种名为 MOLE 2.5 的高级软件工具,该工具旨在分析分子通道和孔隙。 与其他可用软件工具的基准测试表明,MOLE 2.5 相比更快、更强大、功能更丰富。作为一项新功能,MOLE 2.5 可以估算已识别通道的物理化学性质。 软件下载 https://pan.quark.cn/s/57

衡石分析平台使用手册-单机安装及启动

单机安装及启动​ 本文讲述如何在单机环境下进行 HENGSHI SENSE 安装的操作过程。 在安装前请确认网络环境,如果是隔离环境,无法连接互联网时,请先按照 离线环境安装依赖的指导进行依赖包的安装,然后按照本文的指导继续操作。如果网络环境可以连接互联网,请直接按照本文的指导进行安装。 准备工作​ 请参考安装环境文档准备安装环境。 配置用户与安装目录。 在操作前请检查您是否有 sud

论文翻译:arxiv-2024 Benchmark Data Contamination of Large Language Models: A Survey

Benchmark Data Contamination of Large Language Models: A Survey https://arxiv.org/abs/2406.04244 大规模语言模型的基准数据污染:一项综述 文章目录 大规模语言模型的基准数据污染:一项综述摘要1 引言 摘要 大规模语言模型(LLMs),如GPT-4、Claude-3和Gemini的快

线性因子模型 - 独立分量分析(ICA)篇

序言 线性因子模型是数据分析与机器学习中的一类重要模型,它们通过引入潜变量( latent variables \text{latent variables} latent variables)来更好地表征数据。其中,独立分量分析( ICA \text{ICA} ICA)作为线性因子模型的一种,以其独特的视角和广泛的应用领域而备受关注。 ICA \text{ICA} ICA旨在将观察到的复杂信号

【软考】希尔排序算法分析

目录 1. c代码2. 运行截图3. 运行解析 1. c代码 #include <stdio.h>#include <stdlib.h> void shellSort(int data[], int n){// 划分的数组,例如8个数则为[4, 2, 1]int *delta;int k;// i控制delta的轮次int i;// 临时变量,换值int temp;in

三相直流无刷电机(BLDC)控制算法实现:BLDC有感启动算法思路分析

一枚从事路径规划算法、运动控制算法、BLDC/FOC电机控制算法、工控、物联网工程师,爱吃土豆。如有需要技术交流或者需要方案帮助、需求:以下为联系方式—V 方案1:通过霍尔传感器IO中断触发换相 1.1 整体执行思路 霍尔传感器U、V、W三相通过IO+EXIT中断的方式进行霍尔传感器数据的读取。将IO口配置为上升沿+下降沿中断触发的方式。当霍尔传感器信号发生发生信号的变化就会触发中断在中断

kubelet组件的启动流程源码分析

概述 摘要: 本文将总结kubelet的作用以及原理,在有一定基础认识的前提下,通过阅读kubelet源码,对kubelet组件的启动流程进行分析。 正文 kubelet的作用 这里对kubelet的作用做一个简单总结。 节点管理 节点的注册 节点状态更新 容器管理(pod生命周期管理) 监听apiserver的容器事件 容器的创建、删除(CRI) 容器的网络的创建与删除

PostgreSQL核心功能特性与使用领域及场景分析

PostgreSQL有什么优点? 开源和免费 PostgreSQL是一个开源的数据库管理系统,可以免费使用和修改。这降低了企业的成本,并为开发者提供了一个活跃的社区和丰富的资源。 高度兼容 PostgreSQL支持多种操作系统(如Linux、Windows、macOS等)和编程语言(如C、C++、Java、Python、Ruby等),并提供了多种接口(如JDBC、ODBC、ADO.NET等