ML之RS:基于用户的CF+LFM实现的推荐系统(基于相关度较高的用户实现电影推荐)-阿里云开发者社区

开发者社区> 一个处女座的程序猿> 正文

ML之RS:基于用户的CF+LFM实现的推荐系统(基于相关度较高的用户实现电影推荐)

简介: ML之RS:基于用户的CF+LFM实现的推荐系统(基于相关度较高的用户实现电影推荐)
+关注继续查看

输出结果


image.png

image.png

image.png

image.png

image.png










实现代码


#ML之RS:基于CF和LFM实现的推荐系统

import numpy as np

import pandas as pd

import matplotlib.pyplot as plt

import time

import warnings

warnings.filterwarnings('ignore')

np.random.seed(1)

plt.style.use('ggplot')

# data = pd.read_csv('ml-20m/ratings_smaller.csv', index_col=0)

# movies = pd.read_csv('ml-20m/movies_smaller.csv')

#1、导入数据集

data = pd.read_csv('ml-latest-small/ratings.csv')

movies = pd.read_csv('ml-latest-small/movies.csv')

movies = movies.set_index('movieId')[['title', 'genres']]

#2、观察数据集

# How many users?

print (data.userId.nunique(), 'users')

# How many movies?

print (data.movieId.nunique(), 'movies')

# How possible ratings?

print (data.userId.nunique() * data.movieId.nunique(), 'possible ratings')

# How many do we have?

print (len(data), 'ratings')

print (100 * (float(len(data)) / (data.userId.nunique() * data.movieId.nunique())), '% of possible ratings')

# Number of ratings per users

fig = plt.figure(figsize=(10, 10))

ax = plt.hist(data.groupby('userId').apply(lambda x: len(x)).values, bins=50)

plt.xlabel("ratings")

plt.ylabel("users")

plt.title("Number of ratings per user")

plt.show()

# Number of ratings per movie

fig = plt.figure(figsize=(10, 10))

ax = plt.hist(data.groupby('movieId').apply(lambda x: len(x)).values, bins=50)

plt.xlabel("ratings")

plt.ylabel("movies")

plt.title('Number of ratings per movie')

plt.show()

# Ratings distribution评分分布

fig = plt.figure(figsize=(10, 10))

ax = plt.hist(data.rating.values, bins=5)

plt.xlabel("ratings")

plt.ylabel("numbers")

plt.title("Distribution of ratings")

plt.show()

# Average rating per user

fig = plt.figure(figsize=(10, 10))

ax = plt.hist(data.groupby('userId').rating.mean().values, bins=10)

plt.xlabel("Average rating")

plt.ylabel("numbers")

plt.title("Average rating per user")

plt.show()

# Average rating per movie

fig = plt.figure(figsize=(10, 10))

ax = plt.hist(data.groupby('movieId').rating.mean().values, bins=10)

plt.title('Average rating per movie')

plt.show()

# Top Movies,genres电影类型

average_movie_rating = data.groupby('movieId').mean()

top_movies = average_movie_rating.sort_values('rating', ascending=False).head(10)

pd.concat([movies.loc[top_movies.index.values],

          average_movie_rating.loc[top_movies.index.values].rating], axis=1)

# Robust Top Movies - Lets weight the average rating by the square root of number of ratings让平均评分进行加权数的平方根

top_movies = data.groupby('movieId').apply(lambda x:len(x)**0.5 * x.mean()).sort_values('rating', ascending=False).head(10)

pd.concat([movies.loc[top_movies.index.values],

          average_movie_rating.loc[top_movies.index.values].rating], axis=1)

controversial_movies = data.groupby('movieId').apply(lambda x:len(x)**0.25 * x.std()).sort_values('rating', ascending=False).head(10)

pd.concat([movies.loc[controversial_movies.index.values],

          average_movie_rating.loc[controversial_movies.index.values].rating], axis=1)



版权声明:本文内容由阿里云实名注册用户自发贡献,版权归原作者所有,阿里云开发者社区不拥有其著作权,亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容,填写侵权投诉表单进行举报,一经查实,本社区将立刻删除涉嫌侵权内容。

相关文章
怎么设置阿里云服务器安全组?阿里云安全组规则详细解说
阿里云服务器安全组设置规则分享,阿里云服务器安全组如何放行端口设置教程
6846 0
阿里云服务器ECS远程登录用户名密码查询方法
阿里云服务器ECS远程连接登录输入用户名和密码,阿里云没有默认密码,如果购买时没设置需要先重置实例密码,Windows用户名是administrator,Linux账号是root,阿小云来详细说下阿里云服务器远程登录连接用户名和密码查询方法
2796 0
阿里云服务器端口号设置
阿里云服务器初级使用者可能面临的问题之一. 使用tomcat或者其他服务器软件设置端口号后,比如 一些不是默认的, mysql的 3306, mssql的1433,有时候打不开网页, 原因是没有在ecs安全组去设置这个端口号. 解决: 点击ecs下网络和安全下的安全组 在弹出的安全组中,如果没有就新建安全组,然后点击配置规则 最后如上图点击添加...或快速创建.   have fun!  将编程看作是一门艺术,而不单单是个技术。
4408 0
windows server 2008阿里云ECS服务器安全设置
最近我们Sinesafe安全公司在为客户使用阿里云ecs服务器做安全的过程中,发现服务器基础安全性都没有做。为了为站长们提供更加有效的安全基础解决方案,我们Sinesafe将对阿里云服务器win2008 系统进行基础安全部署实战过程! 比较重要的几部分 1.
5412 0
如何设置阿里云服务器安全组?阿里云安全组规则详细解说
阿里云安全组设置详细图文教程(收藏起来) 阿里云服务器安全组设置规则分享,阿里云服务器安全组如何放行端口设置教程。阿里云会要求客户设置安全组,如果不设置,阿里云会指定默认的安全组。那么,这个安全组是什么呢?顾名思义,就是为了服务器安全设置的。安全组其实就是一个虚拟的防火墙,可以让用户从端口、IP的维度来筛选对应服务器的访问者,从而形成一个云上的安全域。
3824 0
阿里云服务器ECS登录用户名是什么?系统不同默认账号也不同
阿里云服务器Windows系统默认用户名administrator,Linux镜像服务器用户名root
1087 0
+关注
一个处女座的程序猿
国内互联网圈知名博主、人工智能领域优秀创作者,全球最大中文IT社区博客专家、CSDN开发者联盟生态成员、中国开源社区专家、华为云社区专家、51CTO社区专家、Python社区专家等,曾受邀采访和评审十多次。仅在国内的CSDN平台,博客文章浏览量超过2500万,拥有超过57万的粉丝。
1701
文章
0
问答
文章排行榜
最热
最新
相关电子书
更多
文娱运维技术
立即下载
《SaaS模式云原生数据仓库应用场景实践》
立即下载
《看见新力量:二》电子书
立即下载