Kaggle 教程系列:机器学习模型是如何工作的?

简介: Kaggle公司是由联合创始人兼首席执行官AnthonyGoldbloom2010年在墨尔本创立的,主要是为开发商和数据科学家提供举办机器学习竞赛、托管数据库、编写和分享代码的平台,Notebook主要支持Python和R。

Kaggle公司是由联合创始人兼首席执行官AnthonyGoldbloom2010年在墨尔本创立的,主要是为开发商和数据科学家提供举办机器学习竞赛、托管数据库、编写和分享代码的平台,Notebook主要支持Python和R。

就我个人来说,我非常喜欢这个平台,它不仅提供了大量的数据集和教程供我们学习,还为每人免费配备了一定的CPU、内存和磁盘资源,并且在交互界面上也非常的赏心悦目。

反观国内的几大平台,PAI需要购买计算资源,存储资源,DC一没有在线分析的资源,提交结果还需要实名认证更是反人类的设定;DC学院提供的课程9.9到699不等,并显得杂乱无章。

介绍

本文来自于Kaggle的官方教程翻译,由于图片不便于翻译,故需要读者略懂一些英文术语。

本文将介绍一个机器学习的模型是如何工作,以及如何使用它们来为我们服务,如果您已经具备这些知识,请跳过本文。

本次课程,我们将一起构建以下场景的模型:

您的堂兄花了数百万投资房地产;他您是所有亲戚里面的数据科学方面的专家,他希望与你一起合作,由他提供资金,而您需要预测各种房屋价格,为他的投资提供建议和决策。

通过餐桌上的交流,堂兄表示以前一直是靠直觉在预测房地产的价值,但睿智的你通过观察发现真相只有一个:他有一套通过旧房地产的价值数据预测新房价的潜在模型,只不过他自己没有意识到。

这就与机器学习的工作方式相似了,我们将从一个名为“决策树”的模型开始,虽然有更高级的模型可以提供更为准确的预测,但决策树相对简单、更容易理解,它是数据科学中一些优秀模型的基础结构。

简单决策树

下图是一颗倒过来的树,嗯,你可以伸出手指,比出剪刀手,然后翻过来,它表示通过一个决定,将产生两种结果。

img_c8cae410b291e87cf361ba9ea028aa4c.png
简单决策树

它将房屋分为两类,而房屋的预测目标则是同一类型房屋的历史平均价。

模型训练

我们使用历史数据来决定如何对房屋进行分类,然后再确定每一类的价格。这一步我们称为拟合或训练模型,用于拟合模型的数据称为训练数据。在代码中通常以train表示,而用于训练的变量为X_train,目标变量为Y_train

模型训练的步骤比较复杂,我们通常是调用现有的科学计算库来完成,并在训练完成后保存它。

数据预测

根据上一步得到训练好的模型,我们将需要预测的新房数据输入,通过模型预测出新房的目标价格。

改进决策树

通过对历史数据的预测,我们的决策树将如何进行选择?

img_d7702bafddd4355fe9f66e520df603f6.png
问题?

当然,只要不傻,我们肯定是选择左侧的树(谁说要选右侧的,请给我来10套这样的房子),因为现实是拥有更多房间的房子更贵。

但是,只通过房间数量来标定一个房价太过儿戏,我们买房通常还要考虑交通、房龄、位置、环境等因素。

这时候,我们要增加树的深度,以进行更多条件的判断:

img_bc8b997b1af5cab7bb43d8b1cf78c4af.png
两层决策数

上面这个树,在房间的基础上增加了对面积的判断,通过训练数据的特征,逐级选择相应的路径,最后达到底部的叶子节点,即是我们需要的预测结果。

原文链接

https://www.kaggle.com/dansbecker/how-models-work

PS: 打开此链接需要一些技术手段

相关文章
|
3天前
|
机器人
1024 云上见 使用 PAI+LLaMA Factory 微调 Qwen2-VL 模型,搭建 “文旅领域知识问答机器人” 领精美计时器
1024 云上见 使用 PAI+LLaMA Factory 微调 Qwen2-VL 模型,搭建 “文旅领域知识问答机器人” 领精美计时器
39 3
|
10天前
|
机器学习/深度学习 数据采集 监控
如何使用机器学习模型来自动化评估数据质量?
【10月更文挑战第6天】如何使用机器学习模型来自动化评估数据质量?
|
9天前
|
数据采集 移动开发 数据可视化
模型预测笔记(一):数据清洗分析及可视化、模型搭建、模型训练和预测代码一体化和对应结果展示(可作为baseline)
这篇文章介绍了数据清洗、分析、可视化、模型搭建、训练和预测的全过程,包括缺失值处理、异常值处理、特征选择、数据归一化等关键步骤,并展示了模型融合技术。
26 1
模型预测笔记(一):数据清洗分析及可视化、模型搭建、模型训练和预测代码一体化和对应结果展示(可作为baseline)
|
1天前
|
机器人
1024 云上见 使用 PAI+LLaMA Factory 微调 Qwen2-VL 模型,搭建 “文旅领域知识问答机器人” 领 200个 精美计时器等你领
1024 云上见 使用 PAI+LLaMA Factory 微调 Qwen2-VL 模型,搭建 “文旅领域知识问答机器人” 领 200个 精美计时器等你领
13 2
|
9天前
|
机器学习/深度学习 前端开发 网络架构
Django如何调用机器学习模型进行预测
Django如何调用机器学习模型进行预测
37 5
|
7天前
|
机器学习/深度学习 算法 Python
深度解析机器学习中过拟合与欠拟合现象:理解模型偏差背后的原因及其解决方案,附带Python示例代码助你轻松掌握平衡技巧
【10月更文挑战第10天】机器学习模型旨在从数据中学习规律并预测新数据。训练过程中常遇过拟合和欠拟合问题。过拟合指模型在训练集上表现优异但泛化能力差,欠拟合则指模型未能充分学习数据规律,两者均影响模型效果。解决方法包括正则化、增加训练数据和特征选择等。示例代码展示了如何使用Python和Scikit-learn进行线性回归建模,并观察不同情况下的表现。
69 3
|
6天前
|
人工智能 算法 测试技术
PAI 大语言模型评测平台现已支持裁判员模型评测
本文将为您介绍如何在 PAI 大语言模型评测平台,基于裁判员模型,评价开源模型或者微调后模型的性能。该功能限时免费,欢迎使用。
|
7天前
|
机器学习/深度学习 数据挖掘 Serverless
手把手教你全面评估机器学习模型性能:从选择正确评价指标到使用Python与Scikit-learn进行实战演练的详细指南
【10月更文挑战第10天】评估机器学习模型性能是开发流程的关键,涉及准确性、可解释性、运行速度等多方面考量。不同任务(如分类、回归)采用不同评价指标,如准确率、F1分数、MSE等。示例代码展示了使用Scikit-learn库评估逻辑回归模型的过程,包括数据准备、模型训练、性能评估及交叉验证。
20 1
|
9天前
|
机器学习/深度学习 计算机视觉 Python
模型预测笔记(三):通过交叉验证网格搜索机器学习的最优参数
本文介绍了网格搜索(Grid Search)在机器学习中用于优化模型超参数的方法,包括定义超参数范围、创建参数网格、选择评估指标、构建模型和交叉验证策略、执行网格搜索、选择最佳超参数组合,并使用这些参数重新训练模型。文中还讨论了GridSearchCV的参数和不同机器学习问题适用的评分指标。最后提供了使用决策树分类器进行网格搜索的Python代码示例。
21 1
|
9天前
|
机器学习/深度学习 数据挖掘
二、机器学习之回归模型分析
二、机器学习之回归模型分析
40 0