Python爬虫模拟登录京东获取个人信息

简介:

  http://www.xgezhang.com/python_crawler_jingdong.html

先上我的代码。参考了上面链接的文章

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
# -*- coding: utf-8 -*-
# !/usr/bin/python
import  os
import  urllib2
import  urllib
import  cookielib
import  re 
import  sys
from  bs4  import  BeautifulSoup
'''
编码方式的设置,在中文使用时用到中文时的处理方式
'''
default_encoding  =  "utf-8"
if  sys.getdefaultencoding() ! =  default_encoding:
   reload (sys)
   sys.setdefaultencoding( "utf-8" )
def  getHtml(url,data = {}):
     if (data = = {}):
         req = urllib2.Request(url)
     else :
         req = urllib2.Request(url,urllib.urlencode(data))
     html = urllib2.urlopen(req).read()
     return  html
try :
     cookie  =  cookielib.CookieJar()
     cookieProc  =  urllib2.HTTPCookieProcessor(cookie)
except :
     raise
else :
      opener  =  urllib2.build_opener(cookieProc)
      opener.addheaders  =  [( 'User-Agent' , 'Mozilla/5.0 (Windows NT 6.1) AppleWebKit/537.11 (KHTML, like Gecko) Chrome/23.0.1271.64 Safari/537.11' )]
      urllib2.install_opener(opener)
auth_url = 'https://passport.jd.com/uc/loginService'
#auth_url = 'http://www.nowamagic.net/'
home_url = 'http://usergrade.jd.com/user/consume'
#home_url = 'http://www.nowamagic.net/librarys/nmra/';
url  =  "https://passport.jd.com/uc/login"
login = getHtml(url)
#print login 
loginSoup  =  BeautifulSoup(login, 'html.parser' )
#查找登陆参数中的uuid
uuid  =  loginSoup.find_all( "form" )[ 0 ].find_all( "input" )[ 0 ][ 'value' ]
print  uuid
clrName = loginSoup.find_all( "form" )[ 0 ].find_all( "input" )[ 6 ][ 'name' ]
clrValue = loginSoup.find_all( "form" )[ 0 ].find_all( "input" )[ 6 ][ 'value' ]
'''这俩参数不是必须。。。。
eid=loginSoup.find_all("form")[0].find_all("input")[4]['value']
fp=loginSoup.find_all("form")[0].find_all("input")[5]['value']
'''
#下载验证码图片:
checkPicUrl  =  loginSoup.find_all( "div" , id = "o-authcode" )[ 0 ].find_all( "img" )[ 0 ][ 'src2' ]
req  =  getHtml(checkPicUrl)
checkPic  =  open ( "checkPic.jpg" , "w" )
checkPic.write(req)
checkPic.close()
#调用mac系统的预览(图像查看器)来打开图片文件
os.system( 'open /Applications/Preview.app/ checkPic.jpg' )
checkCode  =  raw_input ( "请输入弹出图片中的验证码:"
#登录URL
url  =  "http://passport.jd.com/uc/loginService"
# 登陆用户名和密码
postData  =  {
     'loginname' : '你自己的账号' ,
     'nloginpwd' : '你自己的密码' ,
     'loginpwd' : '你自己的密码' ,
     # 'machineNet':'',
     # 'machineCpu':'',
     # 'machineDisk':'', 
     str (clrName): str (clrValue),
     'uuid' :uuid,
     'authcode' : checkCode
}
passport = getHtml(url,postData)
print  passport
# 初始化一个CookieJar来处理Cookie
'''
cookieJar=cookielib.CookieJar()
# 实例化一个全局opener
opener=urllib2.build_opener(urllib2.HTTPCookieProcessor(cookieJar))
# 获取cookie
req=urllib2.Request(auth_url,post_data,headers)
result = opener.open(req)
# 访问主页 自动带着cookie信息
'''
result  =  opener. open ( 'http://i.jd.com/user/info' )
# 显示结果
#print result.read()
soup = BeautifulSoup(result, 'html.parser' )
#昵称
nickName  =  soup.find_all( "input" id = "nickName" )[ 0 ][ "value" ]
print  "nickName:" ,
print  nickName

其实在第一次爬的时候确实是成功返回了{“success”:“http://www.jd.com”}。

但是当我回到寝室再次测试的时候却给我返回了“请刷新页面后重新提交”,暂时还没有解决。


本文转自 努力的C 51CTO博客,原文链接:http://blog.51cto.com/fulin0532/1748590


相关文章
|
11月前
|
数据采集 Web App开发 数据安全/隐私保护
实战:Python爬虫如何模拟登录与维持会话状态
实战:Python爬虫如何模拟登录与维持会话状态
|
12月前
|
数据采集 Web App开发 自然语言处理
新闻热点一目了然:Python爬虫数据可视化
新闻热点一目了然:Python爬虫数据可视化
|
11月前
|
数据采集 监控 数据库
Python异步编程实战:爬虫案例
🌟 蒋星熠Jaxonic,代码为舟的星际旅人。从回调地狱到async/await协程天堂,亲历Python异步编程演进。分享高性能爬虫、数据库异步操作、限流监控等实战经验,助你驾驭并发,在二进制星河中谱写极客诗篇。
Python异步编程实战:爬虫案例
|
12月前
|
数据采集 存储 XML
Python爬虫技术:从基础到实战的完整教程
最后强调: 父母法律法规限制下进行网络抓取活动; 不得侵犯他人版权隐私利益; 同时也要注意个人安全防止泄露敏感信息.
1191 19
|
11月前
|
数据采集 存储 JSON
Python爬虫常见陷阱:Ajax动态生成内容的URL去重与数据拼接
Python爬虫常见陷阱:Ajax动态生成内容的URL去重与数据拼接
|
11月前
|
数据采集 存储 JavaScript
解析Python爬虫中的Cookies和Session管理
Cookies与Session是Python爬虫中实现状态保持的核心。Cookies由服务器发送、客户端存储,用于标识用户;Session则通过唯一ID在服务端记录会话信息。二者协同实现登录模拟与数据持久化。
|
数据采集 测试技术 C++
无headers爬虫 vs 带headers爬虫:Python性能对比
无headers爬虫 vs 带headers爬虫:Python性能对比
|
数据采集 存储 JSON
Python网络爬虫:Scrapy框架的实战应用与技巧分享
【10月更文挑战第27天】本文介绍了Python网络爬虫Scrapy框架的实战应用与技巧。首先讲解了如何创建Scrapy项目、定义爬虫、处理JSON响应、设置User-Agent和代理,以及存储爬取的数据。通过具体示例,帮助读者掌握Scrapy的核心功能和使用方法,提升数据采集效率。
766 6
|
数据采集 存储 搜索推荐
打造个性化网页爬虫:从零开始的Python教程
【8月更文挑战第31天】在数字信息的海洋中,网页爬虫是一艘能够自动搜集网络数据的神奇船只。本文将引导你启航,用Python语言建造属于你自己的网页爬虫。我们将一起探索如何从无到有,一步步构建一个能够抓取、解析并存储网页数据的基础爬虫。文章不仅分享代码,更带你理解背后的逻辑,让你能在遇到问题时自行找到解决方案。无论你是编程新手还是有一定基础的开发者,这篇文章都会为你打开一扇通往数据世界的新窗。
|
数据采集 存储 监控
Python 原生爬虫教程:网络爬虫的基本概念和认知
网络爬虫是一种自动抓取互联网信息的程序,广泛应用于搜索引擎、数据采集、新闻聚合和价格监控等领域。其工作流程包括 URL 调度、HTTP 请求、页面下载、解析、数据存储及新 URL 发现。Python 因其丰富的库(如 requests、BeautifulSoup、Scrapy)和简洁语法成为爬虫开发的首选语言。然而,在使用爬虫时需注意法律与道德问题,例如遵守 robots.txt 规则、控制请求频率以及合法使用数据,以确保爬虫技术健康有序发展。
1710 31

推荐镜像

更多