用groovy采集网页数据

简介:
首先,用 http://groovyconsole.appspot.com/ 测试下面的代码,发现引用总是失败.

下载了GGTS: https://spring.io/tools/ggts

测试成功: 

NewImage

 

@Grapes( @Grab(group='org.ccil.cowan.tagsoup', module='tagsoup', version='1.2') )
import org.ccil.cowan.tagsoup.Parser;

class TestHtml {

public static void main(String[] args){
String ENCODING = "UTF-8"
def PARSER = new XmlSlurper(new Parser() )

def url = "http://www.nfl.com/stats/categorystats?archive=false&conference=null&statisticCategory=PASSING&season=2010&seasonType=REG&experience=null&tabSeq=0&qualified=true&Submit=Go"

new URL(url).withReader (ENCODING) { reader ->

def document = PARSER.parse(reader)
def data = document.'**'.find {it.@class == 'data-table1'}.tbody.tr.collect {
[
Rk: it.td[0].text().trim(),
Player: it.td[1].text().trim(),
PlayerUrl: "http://www.nfl.com" + it.td[1].a.@href.text().trim(),
Team: it.td[2].text().trim(),
Pos: it.td[3].text().trim()
]
}

data.each { it -> println it }
}
}
}


本文转自疯吻IT博客园博客,原文链接:http://www.cnblogs.com/fengwenit/p/5620484.html如需转载请自行联系原作者

目录
打赏
0
0
0
0
60
分享
相关文章
浏览器插件:WebScraper基本用法和抓取页面内容(不会编程也能爬取数据)
本文以百度为实战案例演示使用WebScraper插件抓取页面内容保存到文件中。以及WebScraper用法【2月更文挑战第1天】
736 2
浏览器插件:WebScraper基本用法和抓取页面内容(不会编程也能爬取数据)
网站流量日志分析 —数据采集—页面埋点 JavaScript 收集数据|学习笔记
快速学习网站流量日志分析—数据采集—页面埋点 JavaScript 收集数据
642 0
网站流量日志分析 —数据采集—页面埋点 JavaScript 收集数据|学习笔记
安全开发-PHP应用&模版引用&Smarty渲染&MVC模型&数据联动&RCE安全&TP框架&路由访问&对象操作&内置过滤绕过&核心漏洞
安全开发-PHP应用&模版引用&Smarty渲染&MVC模型&数据联动&RCE安全&TP框架&路由访问&对象操作&内置过滤绕过&核心漏洞
网站流量日志埋点收集 —埋点代码编写—src 属性直接引入|学习笔记
快速学习网站流量日志埋点收集—埋点代码编写—src 属性直接引入
180 0
网站流量日志埋点收集 —埋点代码编写—src 属性直接引入|学习笔记
网站流量日志埋点收集 --埋点代码编写--匿名函数自调用创建标签引入|学习笔记
快速学习网站流量日志埋点收集--埋点代码编写--匿名函数自调用创建标签引入
168 0
网站流量日志埋点收集 --埋点代码编写--匿名函数自调用创建标签引入|学习笔记
springboot 2.0集成webmagic(低配置,自动化采集)(下)
springboot 2.0集成webmagic(低配置,自动化采集)(下)
817 0
springboot 2.0集成webmagic(低配置,自动化采集)(下)
抓取的模板适配工具 Portia 的使用
访问 localhost:9001, 结果404 进到容器,发现 /app/portiaui/dist 文件夹下是空的。 下载 nodejs,yarn
221 0
抓取的模板适配工具 Portia 的使用
DEDE采集功能的使用 DEDE采集规则的导入与导出的方法
我们都知道,DEDECMS开发的默认系统后台自带有采集功能,本篇教程演示教你如何使用DEDE采集功能. 采集的定义: 程序按照指定的规则定向获取其他网站数据的一种方式。
2019 0
AI助理

你好,我是AI助理

可以解答问题、推荐解决方案等