R语言用随机森林模型的酒店收入和产量预测误差分析

简介: R语言用随机森林模型的酒店收入和产量预测误差分析

在这篇文章中,我们将探讨基于随机森林模型的酒店收入和产量预测分析。我们将使用4月9日至4月15日的数据作为测试集,评估预测的准确度点击文末“阅读原文”获取完整代码数据

相关视频

image.png

我们将分别对单个酒店在三个预订渠道的总收入和总产量进行分析,并使用随机森林模型进行预测。通过对比每家酒店的夜预测值(或收入)与实际值的结果,以及产量排名前四分之一酒店的平均误差值,我们将得出对酒店收入和产量的有效预测和分析。

读取数据

首先,我们需要从CSV文件中读取数据。训练集的数据涵盖了从4月1日到4月8日的信息,而测试集的数据则对应于4月9日至4月15日。

data=read.csv("jdfeycdata_test1_4.1-4.8(训练集).csv",header=T)

9ffec234fa59c82acf804dbe6b59aa33.png

以04-9至04-15的数据为测试集评测预测的准确度

test=read.table("jdfeycdata_test1_4.9-4.15(测试集).csv",header=T)

90ddf065ea5a455335e4a02cdef58e51.png

单酒店在三个预订渠道的 总收入

为了预测酒店的总收入,我们需要将来自三个不同预订渠道的收入相加。这一步骤对于训练集和测试集都需要进行。

data$income=data$b_price_after_app +data$c_price_after_app +data$e_price_after_app  
test$income=test$b_price_after_app +test$c_price_after_app +test$e_price_after_app

随机森林预测识别的模型

接下来,我们将使用随机森林算法来建立预测模型。在此之前,我们需要对数据进行预处理,包括转换数据框格式、剔除缺失值等。

c74ca026f69b7d9ff4ab583cfd48cc06.png

#转换数据,拟合随机森林模型  
data=data.frame(data)  
  
##剔除缺失数据  
data=na.omit(data)  
  
  
#建立随机森林
   
rfmodel = randva")

50bfe8837694a3e354a1e07288058c3b.png


每家酒店的夜间预测值(或收入)与实际值的对比结果

完成模型的建立后,我们将使用测试集来评估模型的预测性能。通过对比每家酒店的预测收入与实际收入,我们可以了解模型的准确性。

训练集

ad5e64fe9b8b4b674514b1a169603d41.png


0ef1d58cb85a9f76e990a184be02307d.png

测试集

类似地,我们也可以预测酒店的产量,即每个酒店的总房间数。

8af4925b21191809ff2a26973c309f14.png

21331a02694c6ee9c0b9418c69d4a8bc.png

产量排名前四分之一酒店平均误差值

我们还可以进一步分析产量排名前四分之一的酒店的预测误差,以了解模型在这些关键酒店上的表现。

3e63bc729f4c67ff124fc05e72465e15.png

(∑|每天酒店预测值-每天酒店实际值|/每天酒店实际值)/天数

产量排名前四分之一酒店平均误差:

sum(abs(predict(rfmodel,test )-test$income)/test$income)/length( (test

6701e22af832d8f7285cd8891e9a9a33.png

单酒店在三个预订渠道的总产量

 

data$roomquantity=as.numeric(data$roomquantity)  
test$roomquantity=as.numeric(test$roomquantity)

预测识别的模型方法代码

rfmodel = randst( roomquantit


515d0f868961596497043d09248d46c5.png

每家酒店的夜间预测值(或收入)与实际值的对比结果

310a4db93e4135f8bda685685c29bad1.png

602a0b504fb9792738e527234e0eba43.png

产量排名前四分之一酒店平均误差值

ac828c08011d17e87eb1ac8a5d55db41.png

(∑|每天酒店预测值-每天酒店实际值|/每天酒店实际值)/天数

test=test[test$masterhotelid %in% s40,]

产量排名前四分之一酒店平均误差:

sum(abs(predict(rfmodel,test )-test$roomquantity)/test$roomquantity)/le

6c7fb87ddc2610ea66320147bd1b833a.png

结论

通过上述步骤,我们可以得到一个关于酒店收入和产量的预测模型,并通过测试集来评估其性能。此外,我们还可以分析模型在关键酒店上的表现,从而了解模型在实际应用中的潜在价值。需要注意的是,随机森林模型中的参数(如ntree)应根据具体情况。

相关文章
|
4天前
【R语言实战】——带有新息为标准学生t分布的金融时序的GARCH模型拟合预测
【R语言实战】——带有新息为标准学生t分布的金融时序的GARCH模型拟合预测
|
4天前
【R语言实战】——带有高斯新息的金融时序的GARCH模型拟合预测及VAR/ES风险度量
【R语言实战】——带有高斯新息的金融时序的GARCH模型拟合预测及VAR/ES风险度量
|
4天前
|
数据可视化 数据挖掘 API
【R语言实战】聚类分析及可视化
【R语言实战】聚类分析及可视化
|
4天前
【R语言实战】——Logistic回归模型
【R语言实战】——Logistic回归模型
|
4天前
|
Web App开发 数据可视化 数据挖掘
利用R语言进行聚类分析实战(数据+代码+可视化+详细分析)
利用R语言进行聚类分析实战(数据+代码+可视化+详细分析)
|
4天前
|
数据采集 数据可视化
利用R语言进行因子分析实战(数据+代码+可视化+详细分析)
利用R语言进行因子分析实战(数据+代码+可视化+详细分析)
|
4天前
利用R语言进行典型相关分析实战
利用R语言进行典型相关分析实战
|
4天前
|
机器学习/深度学习 数据可视化
R语言逻辑回归logistic模型ROC曲线可视化分析2例:麻醉剂用量影响、汽车购买行为2
R语言逻辑回归logistic模型ROC曲线可视化分析2例:麻醉剂用量影响、汽车购买行为
|
4天前
|
机器学习/深度学习 算法
R语言分类回归分析考研热现象分析与考研意愿价值变现
R语言分类回归分析考研热现象分析与考研意愿价值变现
|
4天前
|
数据可视化 定位技术
R语言贝叶斯INLA空间自相关、混合效应、季节空间模型、SPDE、时空分析野生动物数据可视化
R语言贝叶斯INLA空间自相关、混合效应、季节空间模型、SPDE、时空分析野生动物数据可视化

热门文章

最新文章