教你用Python爬虫股票评论,简单分析股民用户情绪

简介:

一、背景

股民是网络用户的一大群体,他们的网络情绪在一定程度上反映了该股票的情况,也反映了股市市场的波动情况。作为一只时间充裕的研究僧,我课余时间准备写个小代码get一下股民的评论数据,分析用户情绪的走势。代码还会修改,因为结果不准确,哈哈!

二、数据来源   

本次项目不用于商用,数据来源于东方财富网,由于物理条件,我只获取了一只股票的部分评论,没有爬取官方的帖子,都是获取的散户的评论。

三、数据获取

Python是个好工具,这次我使用了selenium和PhantomJS组合进行爬取网页数据,当然还是要分析网页的dom结构拿到自己需要的数据。

爬虫部分:

from selenium import webdriver  

import time  

import json  

import re    

# from HTMLParser import HTMLParser   

from myNLP import *  

# from lxml import html  

# import requests  

class Crawler:  

   url = ''  

   newurl = set()  

   headers = {}  

   cookies = {}  

   def __init__(self, stocknum, page):  

       self.url = 'http://guba.eastmoney.com/list,'+stocknum+',5_'+page+'.html'  

       cap = webdriver.DesiredCapabilities.PHANTOMJS  

       cap["phantomjs.page.settings.resourceTimeout"] = 1000  

       #cap["phantomjs.page.settings.loadImages"] = False  

       #cap["phantomjs.page.settings.localToRemoteUrlAccessEnabled"] = True  

       self.driver = webdriver.PhantomJS(desired_capabilities=cap)  

   def crawAllHtml(self,url):  

       self.driver.get(url)  

       time.sleep(2)  

#         htmlData = requests.get(url).content.decode('utf-8')  

#         domTree = html.fromstring(htmlData)  

#         return domTree  

   def getNewUrl(self,url):  

       self.newurl.add(url)  

   def filterHtmlTag(self, htmlStr):  

       self.htmlStr = htmlStr    

       #先过滤CDATA    

       re_cdata=re.compile('//<!CDATA

[>]∗//

>',re.I) #匹配CDATA    

       re_script=re.compile('<\s*script[^>]*>[^<]*<\s*/\s*script\s*>',re.I)#Script    

       re_style=re.compile('<\s*style[^>]*>[^<]*<\s*/\s*style\s*>',re.I)#style    

       re_br=re.compile('<br\s*?/?>')#处理换行    

       re_h=re.compile('</?\w+[^>]*>')#HTML标签    

       re_comment=re.compile('<!--[^>]*-->')#HTML注释    

       s=re_cdata.sub('',htmlStr)#去掉CDATA    

       s=re_script.sub('',s) #去掉SCRIPT    

       s=re_style.sub('',s)#去掉style    

       s=re_br.sub('\n',s)#将br转换为换行    

       blank_line=re.compile('\n+')#去掉多余的空行    

       s = blank_line.sub('\n',s)    

       s=re_h.sub('',s) #去掉HTML 标签    

       s=re_comment.sub('',s)#去掉HTML注释    

       #去掉多余的空行    

       blank_line=re.compile('\n+')    

       s=blank_line.sub('\n',s)    

       return s  

   def getData(self):  

       comments = []  

       self.crawAllHtml(self.url)  

       postlist = self.driver.find_elements_by_xpath('//*[@id="articlelistnew"]/div')  

       for post in postlist:  

           href = post.find_elements_by_tag_name('span')[2].find_elements_by_tag_name('a')  

           if len(href):  

               self.getNewUrl(href[0].get_attribute('href'))  

#             if len(post.find_elements_by_xpath('./span[3]/a/@href')):  

#                 self.getNewUrl('http://guba.eastmoney.com'+post.find_elements_by_xpath('./span[3]/a/@href')[0])  

       for url in self.newurl:  

           self.crawAllHtml(url)  

           time = self.driver.find_elements_by_xpath('//*[@id="zwconttb"]/div[2]')  

           post = self.driver.find_elements_by_xpath('//*[@id="zwconbody"]/div')  

           age = self.driver.find_elements_by_xpath('//*[@id="zwconttbn"]/span/span[2]')  

           if len(post) and len(time) and len(age):  

               text = self.filterHtmlTag(post[0].text)  

               if len(text):  

                   tmp = myNLP(text)  

                   comments.append({'time':time[0].text,'content':tmp.prob, 'age':age[0].text})  

           commentlist = self.driver.find_elements_by_xpath('//*[@id="zwlist"]/div')    

           if len(commentlist):  

               for comment in commentlist:  

                   time = comment.find_elements_by_xpath('./div[3]/div[1]/div[2]')  

                   post = comment.find_elements_by_xpath('./div[3]/div[1]/div[3]')  

                   age = comment.find_elements_by_xpath('./div[3]/div[1]/div[1]/span[2]/span[2]')  

                   if len(post) and len(time) and len(age):  

                       text = self.filterHtmlTag(post[0].text)  

                       if len(text):  

                           tmp = myNLP(text)  

                           comments.append({'time':time[0].text,'content':tmp.prob, 'age':age[0].text})  

       return json.dumps(comments)  

存储部分:
这部分其实可以用数据库来做,但是由于只是试水,就简单用json文件来存部分数据:

import io  

class File:  

   name = ''  

   type = ''  

   src = ''  

   file = ''  

   def __init__(self,name, type, src):  

       self.name = name  

       self.type = type  

       self.src = src    

       filename = self.src+self.name+'.'+self.type  

       self.file = io.open(filename,'w+', encoding = 'utf-8')  

   def inputData(self,data):  

       self.file.write(data.decode('utf-8'))  

       self.file.close()  

   def closeFile(self):  

       self.file.close()  

测试用的local服务器:

这里只是为了要用浏览器浏览数据图,由于需要读取数据,js没有权限操作本地的文件,只能利用一个简单的服务器来弄了:

import SimpleHTTPServer  
import SocketServer;  
PORT = 8000  
Handler = SimpleHTTPServer.SimpleHTTPRequestHandler  
httpd = SocketServer.TCPServer(("", PORT), Handler);  
httpd.serve_forever()  

NLP部分:snowNLP这个包还是用来评价买卖东西的评论比较准确

不是专门研究自然语言的,直接使用他人的算法库。这个snowNLP可以建立一个训练,有空自己来弄一个关于股票评论的。

#!/usr/bin/env python  
# -*- coding: UTF-8 -*-  
from snownlp import SnowNLP  
class myNLP:  
    prob = 0.5  
    def _init_(self, text):  
        self.prob = SnowNLP(text).sentiments  

主调度:

# -*- coding: UTF-8 -*-  
''''' 
Created on 2017年5月17日 
@author: luhaiya 
@id: 2016110274 
@description: 
'''  
#http://data.eastmoney.com/stockcomment/  所有股票的列表信息  
#http://guba.eastmoney.com/list,600000,5.html 某只股票股民的帖子页面  
#http://quote.eastmoney.com/sh600000.html?stype=stock 查询某只股票  
from Crawler import *  
from File import *  
import sys  
default_encoding = 'utf-8'  
if sys.getdefaultencoding() != default_encoding:  
    reload(sys)  
    sys.setdefaultencoding(default_encoding)  
             
def main():  
    stocknum = str(600000)  
    total = dict()  
    for i in range(1,10):  
        page = str(i)  
        crawler = Crawler(stocknum, page)  
        datalist = crawler.getData()  
        comments = File(stocknum+'_page_'+page,'json','./data/')  
        comments.inputData(datalist)  
        data = open('./data/'+stocknum+'_page_'+page+'.json','r').read()  
        jsonData = json.loads(data)  
        for detail in jsonData:  
            num = '1' if '年' not in detail['age'].encode('utf-8') else detail['age'].encode('utf-8').replace('年','')  
            num = float(num)  
            date = detail['time'][4:14].encode('utf-8')  
            total[date] = total[date] if date in total.keys() else {'num':0, 'content':0}  
            total[date]['num'] = total[date]['num'] + num if total[date]['num'] else num  
            total[date]['content'] = total[date]['content'] + detail['content']*num if total[date]['content'] else detail['content']*num  
    total = json.dumps(total)  
    totalfile = File(stocknum,'json','./data/')  
    totalfile.inputData(total)  
if __name__ == "__main__":  
    main()  

四、前端数据展示

使用百度的echarts。用户的情绪是使用当天所有评论的情绪值的加权平均,加权系数与用户的股龄正相关。

<!DOCTYPE html>  
<html>  
<head>  
<meta charset="UTF-8">  
<title>分析图表</title>  
<style>  
body{texr-align:center;}  
#mainContainer{width:100%;}  
#fileContainer{width:100%; text-align:center;}  
#picContainer{width: 800px;height:600px;margin:0 auto;}  
</style>  
</head>  
<body>  
<div id = 'mainContainer'>  
<div id = 'fileContainer'>这里是文件夹列表</div>  
<div id = 'picContainer'></div>  
</div>  
<script src="http://apps.bdimg.com/libs/jquery/2.1.1/jquery.min.js"></script>   
<script src = "./echarts.js"></script>  
<script>  
main();  
function main(){  
    var stocknum = 600000;  
    getDate(stocknum);  
}  
function getDate(stocknum){  
    var src = "./data/"+stocknum+".json";  
    $.getJSON(src, function (res){  
        var date = [];  
        for(var key in res){  
            key = key.replace('-','/').replace('-','/');  
            date.push(key);  
        }  
        date.sort();  
        data = [];  
        for (var i = 0; i < date.length; i++) {  
            dat = date[i].replace('/','-').replace('/','-');  
            data.push(res[dat]['content']/res[dat]['num']);  
        }  
        drawPic(date,data);  
    })  
}  
function drawPic(date, data){  
    //initialize and setting options  
    var myChart = echarts.init(document.getElementById('picContainer'));  
    option = {  
        tooltip: {  
            trigger: 'axis',  
            position: function (pt) {  
                return [pt[0], '10%'];  
            }  
        },  
        title: {  
            left: 'center',  
            text: '股票情绪走向图',  
        },  
        toolbox: {  
            feature: {  
                dataZoom: {  
                    yAxisIndex: 'none'  
                },  
                restore: {},  
                saveAsImage: {}  
            }  
        },  
        xAxis: {  
            type: 'category',  
            boundaryGap: false,  
            data: date  
        },  
        yAxis: {  
            type: 'value',  
            boundaryGap: [0, '100%']  
        },  
        dataZoom: [{  
            type: 'inside',  
            start: 0,  
            end: 10  
        }, {  
            start: 0,  
            end: 10,  
            handleIcon: 'M10.7,11.9v-1.3H9.3v1.3c-4.9,0.3-8.8,4.4-8.8,9.4c0,5,3.9,9.1,8.8,9.4v1.3h1.3v-1.3c4.9-0.3,8.8-4.4,8.8-9.4C19.5,16.3,15.6,12.2,10.7,11.9z M13.3,24.4H6.7V23h6.6V24.4z M13.3,19.6H6.7v-1.4h6.6V19.6z',  
            handleSize: '80%',  
            handleStyle: {  
                color: '#fff',  
                shadowBlur: 3,  
                shadowColor: 'rgba(0, 0, 0, 0.6)',  
                shadowOffsetX: 2,  
                shadowOffsetY: 2  
            }  
        }],  
        series: [  
            {  
                name:'stocknum',  
                type:'line',  
                smooth:true,  
                symbol: 'none',  
                sampling: 'average',  
                itemStyle: {  
                    normal: {  
                        color: 'rgb(255, 70, 131)'  
                    }  
                },  
                areaStyle: {  
                    normal: {  
                        color: new echarts.graphic.LinearGradient(0, 0, 0, 1, [{  
                            offset: 0,  
                            color: 'rgb(255, 158, 68)'  
                        }, {  
                            offset: 1,  
                            color: 'rgb(255, 70, 131)'  
                        }])  
                    }  
                },  
                data: data  
            }  
        ]  
    };  
    //draw pic  
    myChart.setOption(option);    
}  
</script>  
</body>  
</html>  

1af8fcdd3ec01053c4edeba851751ca50257d643


图1是我分析用户情绪画出的时间推进图,理论上小于0.5表消极情绪,大于0.5表示积极情绪。图2是实际股价的走势。


原文发布时间为:2017-12-12

本文来自云栖社区合作伙伴“数据派THU”,了解相关信息可以关注“数据派THU”微信公众号

相关文章
|
25天前
|
数据采集 存储 XML
Python爬虫:深入探索1688关键词接口获取之道
在数字化经济中,数据尤其在电商领域的价值日益凸显。1688作为中国领先的B2B平台,其关键词接口对商家至关重要。本文介绍如何通过Python爬虫技术,合法合规地获取1688关键词接口,助力商家洞察市场趋势,优化营销策略。
|
1天前
|
数据采集 Web App开发 监控
Python爬虫:爱奇艺榜单数据的实时监控
Python爬虫:爱奇艺榜单数据的实时监控
|
10天前
|
数据采集 JSON API
如何利用Python爬虫淘宝商品详情高级版(item_get_pro)API接口及返回值解析说明
本文介绍了如何利用Python爬虫技术调用淘宝商品详情高级版API接口(item_get_pro),获取商品的详细信息,包括标题、价格、销量等。文章涵盖了环境准备、API权限申请、请求构建和返回值解析等内容,强调了数据获取的合规性和安全性。
|
15天前
|
数据采集 存储 API
利用Python爬虫获取1688关键词接口全攻略
本文介绍如何使用Python爬虫技术合法合规地获取1688关键词接口数据,包括环境准备、注册1688开发者账号、获取Access Token、构建请求URL、发送API请求、解析HTML及数据处理存储等步骤,强调遵守法律法规和合理使用爬虫技术的重要性。
|
22天前
|
数据采集 JSON 开发者
Python爬虫京东商品详情数据接口
京东商品详情数据接口(JD.item_get)提供商品标题、价格、品牌、规格、图片等详细信息,适用于电商数据分析、竞品分析等。开发者需先注册账号、创建应用并申请接口权限,使用时需遵循相关规则,注意数据更新频率和错误处理。示例代码展示了如何通过 Python 调用此接口并处理返回的 JSON 数据。
|
22天前
|
人工智能 数据可视化 数据挖掘
探索Python编程:从基础到高级
在这篇文章中,我们将一起深入探索Python编程的世界。无论你是初学者还是有经验的程序员,都可以从中获得新的知识和技能。我们将从Python的基础语法开始,然后逐步过渡到更复杂的主题,如面向对象编程、异常处理和模块使用。最后,我们将通过一些实际的代码示例,来展示如何应用这些知识解决实际问题。让我们一起开启Python编程的旅程吧!
|
21天前
|
存储 数据采集 人工智能
Python编程入门:从零基础到实战应用
本文是一篇面向初学者的Python编程教程,旨在帮助读者从零开始学习Python编程语言。文章首先介绍了Python的基本概念和特点,然后通过一个简单的例子展示了如何编写Python代码。接下来,文章详细介绍了Python的数据类型、变量、运算符、控制结构、函数等基本语法知识。最后,文章通过一个实战项目——制作一个简单的计算器程序,帮助读者巩固所学知识并提高编程技能。
|
9天前
|
Unix Linux 程序员
[oeasy]python053_学编程为什么从hello_world_开始
视频介绍了“Hello World”程序的由来及其在编程中的重要性。从贝尔实验室诞生的Unix系统和C语言说起,讲述了“Hello World”作为经典示例的起源和流传过程。文章还探讨了C语言对其他编程语言的影响,以及它在系统编程中的地位。最后总结了“Hello World”、print、小括号和双引号等编程概念的来源。
101 80
|
28天前
|
存储 索引 Python
Python编程数据结构的深入理解
深入理解 Python 中的数据结构是提高编程能力的重要途径。通过合理选择和使用数据结构,可以提高程序的效率和质量
137 59