上交友软件先“测谎”?日本大学生开发匹配模型,60个问题综评价值观,精度达75%

简介: 上交友软件先“测谎”?日本大学生开发匹配模型,60个问题综评价值观,精度达75%

去年年末,日本政府宣布要用AI给民众匹配交往对象,这一新闻一出,引得吃瓜群众纷纷上线。

虽然现在想来仍然感到魔幻,但在文摘菌报道的文章下方,也有读者一针见血地留言指出,这不就是交友软件么?

文摘菌转念一想,那也就是说,人们很有可能仍然会不顾一切地包装自己,“见光死”的现象并不会得到根除。

这个时候,其实只需要哆啦A梦的真假嘴道具就行了。

最近,日本早稻田大学的一个学生团队就把“真假嘴道具”现实化了,并且他们还凭借此获得了“第二届数据科学竞赛”的最高奖。

简单来说,他们主要是通过注册时让用户填写的问卷,对用户在“上进或稳定”“个人或群体”“工作或爱好”三个维度上进行分析,从价值观入手,预测每个人独特的行为方式,从而达到高精度的匹配效果。

从结果上看,利用交叉验证得出的正确率达到了75%,虽然看上去还有很大的改进空间,但考虑到实验数据主要是基于一些企业提供的消费者数据,也可以说十分优秀了。

而且,这个学生团队总共就只有4个人,从大二到研一,是不是感觉更厉害了?赶快和文摘菌一起来看看吧~

从营销专业论文中获得创新灵感

我们都知道,在交友软件上进行匹配的话,系统都是根据用户自己提供的照片和填写的兴趣爱好等特征做出匹配结果。

但不少人也正是利用到了这一点,为了能够和更优秀的人匹配上,不断地在交友软件上粉饰自己,一发不可收拾。

比如,Christian Rudder对美国一个交友软件OkCupid做过一项调查。他发现,一般来说,真人一般会比交友软件填写的身高矮上5厘米;年龄越大的美国人越爱对自己的收入撒谎,一个人的真实收入和约会软件上相比要打个8折。

有没有什么方法能杜绝这种现象呢?

在发表研究提案时,大三学生字井崇晴提到了一个关键点,在一篇营销学论文上,研究人员写过这么一句话,“价值会影响消费者的行为”。

同队的其他成员表示,“价值观这种东西,很多人可能自己也说不怎么上来,因此可能存在有意无意的撒谎行为,如果是这样的话,匹配效果就会非常不理想”。

于是,在开发初期,他们从主办方提供的大量数据中提取了约60项内容,例如“爱好是什么”和“喜欢观看什么样的运动”,并通过应用称为主成分的统计处理将信息压缩为三个维度进行分析,这三个维度也就是“上进或稳定”“个人或群体”“工作或爱好”。

当他们通过交叉验证方法确认所创建的模型时,发现模型的正确率达到了75%。研究团队负责人原健人说到,这表示,基于价值观的匹配比基于可以作假的问题的情况要准确得多。

在决定了“基于消费行为来猜测三轴值”的策略之后,研究人员尝试使用线性回归和随机森林等各种模型来分析数据,从结果上看,算法LightGBM是精度最高的。对于适当的目的变量的提取,也是在不断的试错中进行的。

如果后续该应用程序得以发布,通过接收用户的反馈来获取新的数据的话,那么匹配的精度还会进一步提高。

基于云的机器学习平台与真实数据的结合

这次的数据科学竞赛,早稻田大学提供了由微软为分析环境开发的基于云的机器学习平台“Azure ML”。

之所以决定使用这个平台,一是因为它有一个“设计师”功能,可以让不习惯编码程序的学生通过拖拽的方式建立分析模型,二是它可以安全地在云端完成对敏感和庞大调查数据的处理。

在上述交友软件的开发过程中,学生团队就使用“Jupyter Notebook”编写了用于Python分析的代码,该代码可以轻松地在Azure ML上编写和执行代码。

由于分析数据量很大,在PC的本地环境中就资源而言很难处理。此外,由于数据是从实际调查表中获得的,因此大学方面希望避免在本地下载。Azure的功能与本地分析环境几乎相同,并且可以执行从数据存储到云分析的所有操作,也符合本次竞赛的需求。

团队中负责应用程序开发的铃木说:“我可以立即共享无法在本地保存的数据或想要在线共享的数据,这是一个优势。”

作为竞赛的组织者,数据科学中心的小林学教授表示,“如果你是从头开始安装和设置工具,门槛自然是很高的。此外,为了提高利用分析的能力,Azure ML将为学生提供最新的分析环境。在设置使用量的上限的同时,可以灵活地扩展规格,同时观察学生的使用情况,这也是云技术独有的优势”。

该竞赛的宗旨是将数据科学和各专业领域的知识相结合,来创造新的研究和知识,其目的是通过实际数据的处理来提高数据科学的相关技能,提高学生的能力。

商学院的守口刚教授说:“我们看到每个团队在参加比赛时都使用自己的特殊技能,这取决于他们的专业,但都相当有趣。”

例如,参加比赛的一名理工科学生建议使用一种在商业中不广为人知的最新机器学习方法。商学院的学生擅长将分析结果与商业和营销建议联系起来,“这些方法和观点都给我留下了深刻的印象”。

数据科学中心的野村亮教授说:“当有机会接触到实际数据并获得结果时,学生将变得更有动力并成长。”“明年希望能吸引到更多学生来参加”。

有技术,有真实数据,希望以后在国内,也会有更多脑洞大开的AI被开发出来~

相关报道:
https://www.itmedia.co.jp/news/articles/2103/01/news002.html
https://theblog.okcupid.com/?gi=af6b5f380650

相关文章
|
存储 Prometheus Kubernetes
「译文」通过 Relabel 减少 Prometheus 指标的使用量
「译文」通过 Relabel 减少 Prometheus 指标的使用量
|
3月前
|
存储 人工智能 前端开发
本地离线知识库的隐私底线 数据落用户目录不出域,察元AI还超级智能体
察元AI桌面版坚守“数据不出域”核心承诺:所有对话、知识库、文件、密钥、日志均本地存储(CHAYUAN_ROOT下),默认禁用遥测,Sidecar绑定127.0.0.1,模型密钥强加密。支持Ollama等本地模型实现完全闭环,0字节外传,满足政企等保与国产化合规要求。(239字)
|
10月前
|
数据采集 人工智能 监控
开源 AI 视频监控系统:基于多模态感知的全链路智能交互技术方案
本系统构建了多模态数据采集、高精度识别、智能决策与低延迟交互的全链路技术架构,融合动线热图生成、多设备协同、实时流处理与低代码开发等关键技术,实现顾客行为精准洞察与跨终端智能服务闭环,赋能智慧零售场景。
635 11
|
9月前
|
机器学习/深度学习 缓存 关系型数据库
🎯 注意力机制详解
注意力机制是Transformer核心,实现动态信息聚焦。涵盖自注意力、交叉注意力及多头、分组、多查询等变体,平衡效率与性能。广泛应用于编码器-解码器、多模态融合等场景,是大模型设计与面试考察重点。
|
算法 安全 开发者
优化if-else的11种方案
优化if-else结构的方法多种多样,通过选择合适的方法,可以提高代码的可读性、可维护性和灵活性。本文详细介绍了11种优化if-else的方法,并通过代码示例说明了每种方法的具体应用。希望这些方法能够帮助开发者在实际编程
607 21
|
存储 人工智能 数据中心
Q3财报:阿里云收入增长13%至317.42亿元
Q3财报:阿里云收入增长13%至317.42亿元
1294 13
|
数据可视化 数据挖掘 API
数据驱动如何提升B端产品竞争力?看这篇就够了!
在数字化浪潮下,B端产品(面向企业和组织的产品)成为企业竞争的核心。本文从核心价值、用户体验、数据驱动、生态建设等方面探讨如何打造高价值的B端产品,助力企业提升效率和管理效能。核心价值包括降本增效、提升管理能力、增强决策支持和优化协作体验。用户体验需简化流程、灵活配置、高效呈现数据并实现跨端无缝衔接。数据驱动强调智能分析、自动化决策及数据安全。生态建设则通过API开放、第三方集成和插件市场增强产品粘性。高效协作工具如板栗看板,提供可视化任务管理和多角色权限控制,帮助企业优化协作流程。未来,真正有价值的产品将助力企业持续增长。
|
存储 机器学习/深度学习 搜索推荐
Elasticsearch 8.X 向量检索和普通检索能否实现组合检索?如何实现?
Elasticsearch 8.X 向量检索和普通检索能否实现组合检索?如何实现?
|
存储 数据管理 API
Harmony状态管理AppStorageV2和PersistenceV2
Harmony状态管理AppStorageV2和PersistenceV2
612 0
Harmony状态管理AppStorageV2和PersistenceV2
|
存储 编译器 C语言
【ARM汇编速成】零基础入门汇编语言之C与汇编混合编程(四)
【ARM汇编速成】零基础入门汇编语言之C与汇编混合编程(四)
760 2
【ARM汇编速成】零基础入门汇编语言之C与汇编混合编程(四)

热门文章

最新文章