BeautifulSoup中解决乱码问题-阿里云开发者社区

开发者社区> thinkgamer.cn> 正文

BeautifulSoup中解决乱码问题

简介: 由于初步学习Python爬取网页文本内容,在存储文本时出现乱码问题 我的代码如下: import urllib from bs4 import BeautifulSoup import sys reload(sys) sys.
+关注继续查看

由于初步学习Python爬取网页文本内容,在存储文本时出现乱码问题

我的代码如下:

import urllib

from bs4 import BeautifulSoup

import sys

reload(sys)

sys.setdefaultencoding('utf-8')


fp = file("test.txt","wb+")

page=urllib.urlopen('http://tech.qq.com/a/20150518/031741.htm').read()

soup = BeautifulSoup(page)

div = soup.find_all('div',id="Cnt-Main-Article-QQ")

pp = div[0].find_all('p')

for p in pp:

fp.write(p.get_text())


print "Write Over!!!"

fp.flush()

fp.close()


但打开文本时内容为乱码,上网搜索了好多资料,找到一篇文章,非常简洁的而又完美的解决乱码问题

方法如下:

soup = BeautifulSoup(page)改成soup=BeautifulSoup(page,from_encoding"gb18030")


当你再次打开文本时会惊奇的发现不会乱码了

版权声明:本文内容由阿里云实名注册用户自发贡献,版权归原作者所有,阿里云开发者社区不拥有其著作权,亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容,填写侵权投诉表单进行举报,一经查实,本社区将立刻删除涉嫌侵权内容。

相关文章
字符串乱码问题的解决
package cn.com; //字符串乱码问题的解决 //问题描述: //在TOMCAT里经常出现这种情况:我们输入的字符串是汉字(默认的编码是GBK), //但是TOMCAT默认的是ISO8859-1编码,于是存在了错误,导致了乱码的产生。
593 0
阿里云服务器端口号设置
阿里云服务器初级使用者可能面临的问题之一. 使用tomcat或者其他服务器软件设置端口号后,比如 一些不是默认的, mysql的 3306, mssql的1433,有时候打不开网页, 原因是没有在ecs安全组去设置这个端口号. 解决: 点击ecs下网络和安全下的安全组 在弹出的安全组中,如果没有就新建安全组,然后点击配置规则 最后如上图点击添加...或快速创建.   have fun!  将编程看作是一门艺术,而不单单是个技术。
3958 0
阿里云服务器如何登录?阿里云服务器的三种登录方法
购买阿里云ECS云服务器后如何登录?场景不同,阿里云优惠总结大概有三种登录方式: 登录到ECS云服务器控制台 在ECS云服务器控制台用户可以更改密码、更换系.
5680 0
mysql解决乱码问题
应用场景 在使用mysql数据库的过程中,发现数据导入后中文出现乱码,数据库中出现文字乱码等等,sql语句中查询中文无法查出结果,影响系统使用,以及数据无法正确查询。
676 0
解决adb server端口被占用的问题
先执行adb nodaemon server ,查看adb server的端口是多少 C:\Users\xxxx>adb nodaemon server   cannot bind 'tcp:5037' 再执行下netstat -ano | findstr "5037"   C:\Users\...
539 0
+关注
thinkgamer.cn
wechat 搜索【数据与算法联盟】,专注于云计算和算法,目前就职于京东
121
文章
0
问答
文章排行榜
最热
最新
相关电子书
更多
文娱运维技术
立即下载
《SaaS模式云原生数据仓库应用场景实践》
立即下载
《看见新力量:二》电子书
立即下载