基于R语言实现LASSO回归分析

简介: 基于R语言实现LASSO回归分析

模拟假数据集

set.seed(0820)
 n         <- 50
 p         <- 25
 beta      <- rep(0,p)
 beta\[1:5\] <- 1:5/5
 X <- matrix(rnorm(n*p),n,p)
 X <- scale(X)
 Xb <- X%*%beta
 Y <- X%*%beta+rnorm(n)
 Y <- Y-mean(Y)
 plot(cor(X,Y),xlab="j",ylab="Cor(Y,X_j)",main="Sample correlations",cex=2)

标准最小二乘法

summary(ols)
## 
## Call:
## 
## Residuals:
##      Min       1Q   Median       3Q      Max 
## -2.54540 -0.38971 -0.00738  0.49058  1.90900 
## 
## Coefficients:
##               Estimate Std. Error t value Pr(>|t|)    
## (Intercept) -3.914e-16  1.648e-01   0.000  1.00000    
## X1           6.020e-01  2.097e-01   2.871  0.00841 ** 
## X2           5.924e-01  2.013e-01   2.944  0.00709 ** 
## X3          -1.106e-01  2.290e-01  -0.483  0.63363    
## X4           1.117e+00  2.058e-01   5.427 1.42e-05 ***
## X5           1.234e+00  2.190e-01   5.633 8.46e-06 ***
## X6          -3.225e-01  2.322e-01  -1.389  0.17755    
## X7          -1.954e-01  2.150e-01  -0.909  0.37231    
## X8           1.466e-01  2.532e-01   0.579  0.56803    
## X9           4.678e-02  2.353e-01   0.199  0.84409    
## X10         -2.779e-01  2.151e-01  -1.292  0.20864    
## X11         -7.308e-02  2.553e-01  -0.286  0.77717    
## X12         -4.424e-02  2.642e-01  -0.167  0.86839    
## X13         -1.078e-01  2.101e-01  -0.513  0.61270    
## X14          3.000e-01  2.263e-01   1.326  0.19743    
## X15          2.396e-01  2.480e-01   0.966  0.34365    
## X16         -1.178e-01  2.285e-01  -0.515  0.61100    
## X17         -2.409e-01  2.280e-01  -1.057  0.30104    
## X18         -3.191e-01  2.396e-01  -1.332  0.19551    
## X19         -1.207e-01  2.372e-01  -0.509  0.61553    
## X20          1.721e-01  2.179e-01   0.790  0.43733    
## X21         -1.677e-02  2.144e-01  -0.078  0.93831    
## X22          3.706e-02  2.145e-01   0.173  0.86426    
## X23          3.233e-02  2.108e-01   0.153  0.87938    
## X24         -1.541e-01  2.343e-01  -0.658  0.51691    
## X25         -1.970e-01  1.965e-01  -1.002  0.32622    
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## Residual standard error: 1.166 on 24 degrees of freedom
## Multiple R-squared:  0.8416, Adjusted R-squared:  0.6767 
## F-statistic: 5.102 on 25 and 24 DF,  p-value: 7.861e-05

LASSO

``````
 plot(lasso)

使用BIC选择路径上的最佳点

##           df       MSE      bic
## Intercept  1 4.1174138 74.67329
##            2 3.8224639 74.86881
##            3 1.9171062 44.27691
##            4 1.9136899 48.09976
##            5 1.5118875 40.22806
##            6 1.3016560 36.65400
##            7 1.2693779 39.31051
##            8 1.2124870 40.92986
##            9 1.1814011 43.54326
##           10 1.1728179 47.09070
##           11 1.1016346 47.87201
##           12 1.0050559 47.19643
##           13 0.9867377 50.18875
##           14 0.9636054 52.91465
##           15 0.8686856 51.64164
##           16 0.7777734 50.02637
##           17 0.7700763 53.44111
##           18 0.7663544 57.11089
##           19 0.7510361 60.01336
##           20 0.7451598 63.53263
##           19 0.7196873 57.88151
##           20 0.7149486 61.46323
##           21 0.7141592 65.32002
##           20 0.7051259 60.77152
##           21 0.6875391 63.42065
##           22 0.6764241 66.51776
##           23 0.6739037 70.24313
##           24 0.6570954 72.89225
##           25 0.6564105 76.75213
##           26 0.6520870 80.33373

结果

# beta真值
 
##  \[1\] 0.2 0.4 0.6 0.8 1.0 0.0 0.0 0.0 0.0 0.0 0.0 0.0 0.0 0.0 0.0 0.0 0.0
## \[18\] 0.0 0.0 0.0 0.0 0.0 0.0 0.0 0.0
 #使用最小二乘预测beta
 round(beta_ols,3)
##     X1     X2     X3     X4     X5     X6     X7     X8     X9    X10 
##  0.602  0.592 -0.111  1.117  1.234 -0.323 -0.195  0.147  0.047 -0.278 
##    X11    X12    X13    X14    X15    X16    X17    X18    X19    X20 
## -0.073 -0.044 -0.108  0.300  0.240 -0.118 -0.241 -0.319 -0.121  0.172 
##    X21    X22    X23    X24    X25 
## -0.017  0.037  0.032 -0.154 -0.197
 # LASSO预测beta
 round(beta_lasso,3)
##  \[1\]  0.238  0.238  0.000  0.900  0.786  0.000  0.000  0.000  0.000  0.000
## \[11\]  0.000  0.000  0.000  0.000  0.000  0.000  0.000  0.000  0.000  0.000
## \[21\]  0.000  0.000  0.000  0.000 -0.075
 #MSE - OLS
 mean((beta-beta_ols)^2)
## \[1\] 0.06204978
 #MSE - LASSO
 mean((beta-beta_lasso)^2)
## \[1\] 0.01795647

相关文章
|
3月前
|
数据采集 机器学习/深度学习 数据可视化
R语言从数据到决策:R语言在商业分析中的实践
【9月更文挑战第1天】R语言在商业分析中的应用广泛而深入,从数据收集、预处理、分析到预测模型构建和决策支持,R语言都提供了强大的工具和功能。通过学习和掌握R语言在商业分析中的实践应用,我们可以更好地利用数据驱动企业决策,提升企业的竞争力和盈利能力。未来,随着大数据和人工智能技术的不断发展,R语言在商业分析领域的应用将更加广泛和深入,为企业带来更多的机遇和挑战。
|
2月前
|
数据挖掘 C语言 C++
R语言是一种强大的统计分析工具,提供了丰富的函数和包用于时间序列分析。
【10月更文挑战第21天】时间序列分析是一种重要的数据分析方法,广泛应用于经济学、金融学、气象学、生态学等领域。R语言是一种强大的统计分析工具,提供了丰富的函数和包用于时间序列分析。本文将介绍使用R语言进行时间序列分析的基本概念、方法和实例,帮助读者掌握R语言在时间序列分析中的应用。
52 3
|
7月前
|
数据可视化 数据挖掘 API
【R语言实战】聚类分析及可视化
【R语言实战】聚类分析及可视化
|
3月前
|
数据采集 数据可视化 数据挖掘
R语言在金融数据分析中的深度应用:探索数据背后的市场智慧
【9月更文挑战第1天】R语言在金融数据分析中展现出了强大的功能和广泛的应用前景。通过丰富的数据处理函数、强大的统计分析功能和优秀的可视化效果,R语言能够帮助金融机构深入挖掘数据价值,洞察市场动态。未来,随着金融数据的不断积累和技术的不断进步,R语言在金融数据分析中的应用将更加广泛和深入。
|
4月前
|
机器学习/深度学习 数据采集 数据可视化
R语言在数据科学中的应用实例:探索与预测分析
【8月更文挑战第31天】通过上述实例,我们展示了R语言在数据科学中的强大应用。从数据准备、探索、预处理到建模与预测,R语言提供了完整的解决方案和丰富的工具集。当然,数据科学远不止于此,随着技术的不断发展和业务需求的不断变化,我们需要不断学习和探索新的方法和工具,以更好地应对挑战,挖掘数据的潜在价值。 未来,随着大数据和人工智能技术的普及,R语言在数据科学领域的应用将更加广泛和深入。我们期待看到更多创新的应用实例,为各行各业的发展注入新的动力。
|
4月前
|
数据采集 存储 数据可视化
R语言时间序列分析:处理与建模时间序列数据的深度探索
【8月更文挑战第31天】R语言作为一款功能强大的数据分析工具,为处理时间序列数据提供了丰富的函数和包。从数据读取、预处理、建模到可视化,R语言都提供了灵活且强大的解决方案。然而,时间序列数据的处理和分析是一个复杂的过程,需要结合具体的应用场景和需求来选择合适的方法和模型。希望本文能为读者在R语言中进行时间序列分析提供一些有益的参考和启示。
|
4月前
|
资源调度 数据挖掘
R语言回归分析:线性回归模型的构建与评估
【8月更文挑战第31天】线性回归模型是统计分析中一种重要且实用的工具,能够帮助我们理解和预测自变量与因变量之间的线性关系。在R语言中,我们可以轻松地构建和评估线性回归模型,从而对数据背后的关系进行深入的探索和分析。
|
4月前
|
机器学习/深度学习 数据采集
R语言逻辑回归、GAM、LDA、KNN、PCA主成分分类分析预测房价及交叉验证
上述介绍仅为简要概述,每个模型在实施时都需要仔细调整与优化。为了实现高度精确的预测,模型选择与调参是至关重要的步骤,并且交叉验证是提升模型稳健性的有效途径。在真实世界的房价预测问题中,可能还需要结合地域经济、市场趋势等宏观因素进行综合分析。
86 3
|
7月前
|
数据采集 数据可视化
利用R语言进行因子分析实战(数据+代码+可视化+详细分析)
利用R语言进行因子分析实战(数据+代码+可视化+详细分析)
|
7月前
|
Web App开发 数据可视化 数据挖掘
利用R语言进行聚类分析实战(数据+代码+可视化+详细分析)
利用R语言进行聚类分析实战(数据+代码+可视化+详细分析)