对于Python抓取Google搜索结果的一些了解

简介: 对于Python抓取Google搜索结果的一些了解

1.问题


目前主流的搜索引擎,非 google莫属,但其对于非法(流量异常、爬虫)请求的封锁也是异常严厉


本人前段时间有个脚本用到了谷歌搜索,具体见Python之由公司名推算出公司官网(余弦相似度)当时直接使用的是一个 python开源项目


但在使用过程中,单 ip的情况下爬取速度可谓感人,稍不留神还会被封,所以对于获取谷歌搜索结果的爬虫有必要进行改进


说一说爬取谷歌搜索结果的问题:


  • 1.正常打开谷歌搜索,然后审查元素想获取目标内容的时候,会发现是一大串js。

  • 2.访问过快就会出现流量异常

2.如何解决


对于第一个问题:

1.jpg

应该有看到审查元素出来的都是js,然后检索的url是这样的:


https://www.google.com.hk/search?q=hello&oq=hello&aqs=chrome..69i57j69i60l2j69i65j69i60j0.876j0j7&sourceid=chrome&ie=UTF-8&google_abuse=GOOGLE_ABUSE_EXEMPTION%3DID%3Daa946d8c657cf359:TM%3D1484917472:C%3Dr:IP%3D118.193.241.44-:S%3DAPGng0tGiKFaIr7YCaivUEmmEHOYJhG4jg%3B+path%3D/%3B+domain%3Dgoogle.com%3B+expires%3DFri,+20-Jan-2017+16:04:32+GMT


这里解决办法很粗暴,禁止掉js就好,让我们看看禁止js后是什么样的:

2.jpg

然后再看url: https://www.google.com.hk/search?q=hello&btnG=Search&safe=active&gbv=1


对于这个 url,相信机智的你应该会明白些什么


这里可以写个简单的脚本,比如说获取,谷歌搜索第一页所有结果的 html,简单写下:

 URL_SEARCH = "https://{domain}/search?hl={language}&q={query}&btnG=Search&gbv=1"
   URL_NUM = "https://{domain}/search?hl={language}&q={query}&btnG=Search&gbv=1&num={num}"
   def search_page(query, language='en', num=None, start=0, pause=2):
       """
       Google search
       :param query: Keyword
       :param language: Language
       :return: result
       """
       time.sleep(pause)
       domain = self.get_random_domain()
       if num is None:
           url = URL_SEARCH
           url = url.format(
               domain=domain, language=language, query=quote_plus(query))
       else:
           url = URL_NUM
           url = url.format(
               domain=domain, language=language, query=quote_plus(query), num=num)
       try:
           requests.packages.urllib3.disable_warnings(InsecureRequestWarning)
           r = requests.get(url=url,
                            allow_redirects=False,
                            verify=False,
                            timeout=30)
           charset = chardet.detect(r.content)
           content = r.content.decode(charset['encoding'])
           return content
       except Exception as e:
           logging.error(e)
           return None

到了这里,问题才刚开始,你可以做个实验,我假设你是使用代理进行谷歌搜索,如果你连续不断无间隔使用谷歌搜索某一关键字二三十下,不出意外你会被要求进行这样的验证:


3.jpg

这个问题可真是让人十分厌恶,我并没有很好的解决办法,能做的唯有尽量避免:


1.ip轮询 2.每次结果爬取增加休眠 3.随机user_agent是必备


第一点和第三点不必多说,对于第二点增加休眠时间则需要我们好好地进行检测。 假设在单ip随机ua情况下:


  • 1.这种情况下不休眠的话请求个两三次就会直接被封(第二天会被解封)

  • 2.个人觉得这不是个解决办法,因为对休眠时间把控不好的话就会造成封ip,如果不想被封,我测试的话需要休眠60s浮动,这没什么意义

  • 3.而且这种情况下发现是直接封ip,对开发者太不友好

对于这种情况,受同事神来一句,发现一个暂时的解决办法,请看下图:

4.jpg

单一ip不停地访问统一谷歌域名自然很容易被察觉,谷歌全球190+的域名,难道都在实时的统计ip么,可能有,但绝对不会像单域名那样严格,来做个测试。


我将全球190+谷歌域名集中起来,像ua一样随机轮换,然后进行测试(单ip),结果还不错:


  • 1.首先没有出现被封ip,只会提示流量异常

  • 2.还是需要休眠,本人休眠5~15s没有被封过,可根据自身情况来,如果想稳妥点就5~30s吧

我将这些写成了一个项目,magic_google-python,若你是phper,可以看看我写的php版本php-google,具体代码可以看这里,对应的功能很简单:

from magic_google import MagicGoogle
import pprint
# Or PROXIES = None
PROXIES = [{
   'http': 'http://192.168.2.207:1080',
   'https': 'http://192.168.2.207:1080'
}]
# Or MagicGoogle()
mg = MagicGoogle(PROXIES)
#  Crawling the whole page
result = mg.search_page(query='python')
# Crawling url
for url in mg.search_url(query='python'):
   pprint.pprint(url)
# Output
# 'https://www.python.org/'
# 'https://www.python.org/downloads/'
# 'https://www.python.org/about/gettingstarted/'
# 'https://docs.python.org/2/tutorial/'
# 'https://docs.python.org/'
# 'https://en.wikipedia.org/wiki/Python_(programming_language)'
# 'https://www.codecademy.com/courses/introduction-to-python-6WeG3/0?curriculum_id=4f89dab3d788890003000096'
# 'https://www.codecademy.com/learn/python'
# 'https://developers.google.com/edu/python/'
# 'https://learnpythonthehardway.org/book/'
# 'https://www.continuum.io/downloads'
# Get {'title','url','text'}
for i in mg.search(query='python', num=1):
   pprint.pprint(i)
# Output
# {'text': 'The official home of the Python Programming Language.',
# 'title': 'Welcome to Python .org',
# 'url': 'https://www.python.org/'}

3.总结


对google搜索结果的提取,有以下建议:


  • 1.ip轮询

  • 2.ua随机

  • 3.domain随机

  • 4.休眠

源码已开源在GitHub,有兴趣可查看源码:https://github.com/howie6879/magic_google

相关文章
|
10月前
|
缓存 供应链 监控
1688item_search_factory - 按关键字搜索工厂数据接口深度分析及 Python 实现
item_search_factory接口专为B2B电商供应链优化设计,支持通过关键词精准检索工厂信息,涵盖资质、产能、地理位置等核心数据,助力企业高效开发货源、分析产业集群与评估供应商。
|
11月前
|
缓存 API 网络架构
淘宝item_search_similar - 搜索相似的商品API接口,用python返回数据
淘宝联盟开放平台中,可通过“物料优选接口”(taobao.tbk.dg.optimus.material)实现“搜索相似商品”功能。该接口支持根据商品 ID 获取相似推荐商品,并返回商品信息、价格、优惠等数据,适用于商品推荐、比价等场景。本文提供基于 Python 的实现示例,包含接口调用、数据解析及结果展示。使用时需配置淘宝联盟的 appkey、appsecret 和 adzone_id,并注意接口调用频率限制和使用规范。
|
10月前
|
JSON 监控 数据格式
1688 item_search_app 关键字搜索商品接口深度分析及 Python 实现
1688开放平台item_search_app接口专为移动端优化,支持关键词搜索、多维度筛选与排序,可获取商品详情及供应商信息,适用于货源采集、价格监控与竞品分析,助力采购决策。
|
10月前
|
缓存 供应链 监控
VVIC seller_search 排行榜搜索接口深度分析及 Python 实现
VVIC搜款网seller_search接口提供服装批发市场的商品及商家排行榜数据,涵盖热销榜、销量排名、类目趋势等,支持多维度筛选与数据分析,助力选品决策、竞品分析与市场预测,为服装供应链提供有力数据支撑。
|
10月前
|
缓存 监控 算法
唯品会item_search - 按关键字搜索 VIP 商品接口深度分析及 Python 实现
唯品会item_search接口支持通过关键词、分类、价格等条件检索商品,广泛应用于电商数据分析、竞品监控与市场调研。结合Python可实现搜索、分析、可视化及数据导出,助力精准决策。
|
10月前
|
Web App开发 缓存 监控
微店店铺商品搜索(item_search_shop)接口深度分析及 Python 实现
item_search_shop接口用于获取特定店铺的全部商品数据,支持批量获取商品列表、基础信息、价格、销量等,适用于竞品监控、商品归类及店铺分析等场景,助力全面了解店铺经营状况。
|
10月前
|
JSON 缓存 供应链
电子元件 item_search - 按关键字搜索商品接口深度分析及 Python 实现
本文深入解析电子元件item_search接口的设计逻辑与Python实现,涵盖参数化筛选、技术指标匹配、供应链属性过滤及替代型号推荐等核心功能,助力高效精准的电子元器件搜索与采购决策。
|
10月前
|
缓存 自然语言处理 算法
item_search - Lazada 按关键字搜索商品接口深度分析及 Python 实现
Lazada的item_search接口是关键词搜索商品的核心工具,支持多语言、多站点,可获取商品价格、销量、评分等数据,适用于市场调研与竞品分析。