如何找到时序数据中线性的趋势(时序数据分析算法)
ztj100 2024-11-08 15:06 34 浏览 0 评论
有时需要从时序数据中删除趋势,为下一步或数据清理过程的一部分做准备。如果您可以确定趋势,那么只需从数据中减去它,结果就是非趋势数据。
如果趋势是线性的,你可以通过线性回归找到它。但如果趋势不是线性的呢?我们一会儿就会看到我们能做些什么。
但是在此之前,我们先看看什么叫线性趋势
线性趋势
下面是带有趋势的时序数据:
https://raw.githubusercontent.com/FlorinAndrei/misc/master/qdata.csv
让我们加载它,看看它是什么样子:
import pandas as pd
import numpy as np
import matplotlib.pyplot as plt
from sklearn.linear_model import LinearRegression
from sklearn.preprocessing import PolynomialFeatures
from sklearn.metrics import mean_squared_error, r2_scoreser = pd.read_csv('qdata.csv', index_col=0, squeeze=True)
serx
0 473.917764
1 75.324825
2 -306.969479
3 53.271476
4 372.966686
...
95 4650.550473
96 4604.573344
97 4891.704638
98 5265.948162
99 5618.909339
Name: y, Length: 100, dtype: float64plt.plot(ser)
plt.show()
好的,这里有一个趋势。我们假设它是线性的,我们来做线性回归来找出答案。这是线性回归的一个直接应用。上面导入的sklearn库拥有我们进行回归所需要的一切。
X = ser.index
X = np.reshape(X, (len(X), 1))
y = ser.valuesmodel = LinearRegression()
model.fit(X, y)
trend = model.predict(X)plt.plot(y)
plt.plot(trend)
plt.legend(['data', 'trend'])
plt.show()
看起来很合适,但可能不是很合适。让我们从数据中减去趋势,看看非趋势数据是什么样的:
detr = [y[i] - trend[i] for i in range(0, len(y))]
plt.plot(detr)
plt.title('data detrended in a linear fashion')
plt.show()
不是很令人信服。数据中仍有一个凹的趋势。最初的趋势可能不是线性的。
让我们计算数据和我们提取的趋势之间的RMSE和R2。
r2 = r2_score(y, trend)
rmse = np.sqrt(mean_squared_error(y, trend))
print('r2:', r2)
print('rmse', rmse)
r2: 0.8782399672701933
rmse 553.6078593008505
多项式趋势
如果趋势不是线性的,我们可以尝试用多项式曲线来拟合它。但问题是:即使我们拟合的曲线是高次多项式,我们仍然可以用线性回归来找到它。
考虑这个二次表达式:
y = a + bx + cx2
我们要找的值是a, b, c,和他们都是线性的。忘记x的权重,我们看的是权重,b和c,所以线性回归——它只是发生,我们将不得不在多个维度做线性回归。
假设数据呈二次趋势。然后我们需要把X变换成二次形式:
pf = PolynomialFeatures(degree=2)
Xp = pf.fit_transform(X)
Xp
array([[1.000e+00, 0.000e+00, 0.000e+00],
[1.000e+00, 1.000e+00, 1.000e+00],
[1.000e+00, 2.000e+00, 4.000e+00],
[1.000e+00, 3.000e+00, 9.000e+00],
[1.000e+00, 4.000e+00, 1.600e+01],
[1.000e+00, 5.000e+00, 2.500e+01],
[1.000e+00, 6.000e+00, 3.600e+01],
...
[1.000e+00, 9.600e+01, 9.216e+03],
[1.000e+00, 9.700e+01, 9.409e+03],
[1.000e+00, 9.800e+01, 9.604e+03],
[1.000e+00, 9.900e+01, 9.801e+03]])
第一列是X的0次方。第二列是X,第三列是X的2次方。这就像上面显示的二次表达式(y = a + bx + cx)
现在我们将使用二次形式来拟合数据并生成二次趋势。用线性回归方法求出二次表达式的参数。
md2 = LinearRegression()
md2.fit(Xp, y)
trendp = md2.predict(Xp)
趋势是怎样的?
plt.plot(X, y)
plt.plot(X, trendp)
plt.legend(['data', 'polynomial trend'])
plt.show()
更接近了,不是吗?现在让我们看看非趋势数据:
detrpoly = [y[i] - trendp[i] for i in range(0, len(y))]
plt.plot(X, detrpoly)
plt.title('polynomially detrended data')
plt.show()
这显然更好。没有任何可以从视觉上看出的趋势。但是让我们看看数字是怎么说的:
r2 = r2_score(y, trendp)
rmse = np.sqrt(mean_squared_error(y, trendp))
print('r2:', r2)
print('rmse', rmse)
r2: 0.9343217231542871
rmse 406.5937924291518
与线性趋势相比,随着多项式趋势,R2曲线增大,RMSE减小。两者都是好的改变。两种均值多项式的拟合效果都优于线性拟合。
高阶多项式
你可以选择任意阶的多项式只要在这里给N赋不同的值:
pf = PolynomialFeatures(degree=N)
一般来说,对N使用较低的值。如果增加了N,发生的情况不太严重,则返回较小的值。
只有一个弯曲的曲线可以用二次函数来描述。有两个弯的曲线可以用三次函数来描述。等等。N-1弯需要一个N次幂的表达式。
如果N增加很多,最终你的"最佳拟合"曲线将开始跟随数据中的杂音,而不是拟合趋势。你已经超拟合了曲线,现在没有意义了。或者减少N,或者增加更多数据点。
这样我们将这个线性模型的数据去除(差值),使用剩余的数据进行时间序列的训练,可以得到更精确的结果
相关推荐
- 离谱!写了5年Vue,还不会自动化测试?
-
前言大家好,我是倔强青铜三。是一名热情的软件工程师,我热衷于分享和传播IT技术,致力于通过我的知识和技能推动技术交流与创新,欢迎关注我,微信公众号:倔强青铜三。Playwright是一个功能强大的端到...
- package.json 与 package-lock.json 的关系
-
模块化开发在前端越来越流行,使用node和npm可以很方便的下载管理项目所需的依赖模块。package.json用来描述项目及项目所依赖的模块信息。那package-lock.json和...
- Github 标星35k 的 SpringBoot整合acvtiviti开源分享,看完献上膝盖
-
前言activiti是目前比较流行的工作流框架,但是activiti学起来还是费劲,还是有点难度的,如何整合在线编辑器,如何和业务表单绑定,如何和系统权限绑定,这些问题都是要考虑到的,不是说纯粹的把a...
- Vue3 + TypeScript 前端研发模板仓库
-
我们把这个Vue3+TypeScript前端研发模板仓库的初始化脚本一次性补全到可直接运行的状态,包括:完整的目录结构所有配置文件研发规范文档示例功能模块(ExampleFeature)...
- Vue 2迁移Vue 3:从响应式到性能优化
-
小伙伴们注意啦!Vue2已经在2023年底正式停止维护,再不升级就要面临安全漏洞没人管的风险啦!而且Vue3带来的性能提升可不是一点点——渲染速度快40%,内存占用少一半,更新速度直接翻倍!还在...
- VUE学习笔记:声明式渲染详解,对比WEB与VUE
-
声明式渲染是指使用简洁的模板语法,声明式的方式将数据渲染进DOM系统。声明式是相对于编程式而言,声明式是面向对象的,告诉框架做什么,具体操作由框架完成。编程式是面向过程思想,需要手动编写代码完成具...
- 苏州web前端培训班, 苏州哪里有web前端工程师培训
-
前端+HTML5德学习内容:第一阶段:前端页面重构:PC端网站布局、HTML5+CSS3基础项目、WebAPP页面布局;第二阶段:高级程序设计:原生交互功能开发、面向对象开发与ES5/ES6、工具库...
- 跟我一起开发微信小程序——扩展组件的代码提示补全
-
用户自定义代码块步骤:1.HBuilderX中工具栏:工具-代码块设置-vue代码块2.通过“1”步骤打开设置文件...
- JimuReport 积木报表 v1.9.3发布,免费可视化报表
-
项目介绍积木报表JimuReport,是一款免费的数据可视化报表,含报表、大屏和仪表盘,像搭建积木一样完全在线设计!功能涵盖:数据报表、打印设计、图表报表、门户设计、大屏设计等!...
- 软开企服开源的无忧企业文档(V2.1.3)产品说明书
-
目录1....
- 一款面向 AI 的下一代富文本编辑器,已开源
-
简介AiEditor是一个面向AI的下一代富文本编辑器。开箱即用、支持所有前端框架、支持Markdown书写模式什么是AiEditor?AiEditor是一个面向AI的下一代富文本编辑...
- 玩转Markdown(2)——抽象语法树的提取与操纵
-
上一篇玩转Markdown——数据的分离存储与组件的原生渲染发布,转眼已经鸽了大半年了。最近在操纵mdast生成md文件的时候,心血来潮,把玩转Markdown(2)给补上了。...
- DeepseekR1+ollama+dify1.0.0搭建企业/个人知识库(入门避坑版)
-
找了网上的视频和相关文档看了之后,可能由于版本不对或文档格式不对,很容易走弯路,看完这一章,可以让你少踩三天的坑。步骤和注意事项我一一列出来:1,前提条件是在你的电脑上已配置好ollama,dify1...
- 升级JDK17的理由,核心是降低GC时间
-
升级前后对比升级方法...
- 一个vsCode格式化插件_vscode格式化插件缩进量
-
ESlint...
你 发表评论:
欢迎- 一周热门
-
-
MySQL中这14个小玩意,让人眼前一亮!
-
旗舰机新标杆 OPPO Find X2系列正式发布 售价5499元起
-
【VueTorrent】一款吊炸天的qBittorrent主题,人人都可用
-
面试官:使用int类型做加减操作,是线程安全吗
-
C++编程知识:ToString()字符串转换你用正确了吗?
-
【Spring Boot】WebSocket 的 6 种集成方式
-
PyTorch 深度学习实战(26):多目标强化学习Multi-Objective RL
-
pytorch中的 scatter_()函数使用和详解
-
与 Java 17 相比,Java 21 究竟有多快?
-
基于TensorRT_LLM的大模型推理加速与OpenAI兼容服务优化
-
- 最近发表
- 标签列表
-
- idea eval reset (50)
- vue dispatch (70)
- update canceled (42)
- order by asc (53)
- spring gateway (67)
- 简单代码编程 贪吃蛇 (40)
- transforms.resize (33)
- redisson trylock (35)
- 卸载node (35)
- np.reshape (33)
- torch.arange (34)
- npm 源 (35)
- vue3 deep (35)
- win10 ssh (35)
- vue foreach (34)
- idea设置编码为utf8 (35)
- vue 数组添加元素 (34)
- std find (34)
- tablefield注解用途 (35)
- python str转json (34)
- java websocket客户端 (34)
- tensor.view (34)
- java jackson (34)
- vmware17pro最新密钥 (34)
- mysql单表最大数据量 (35)