开发者社区> 问答> 正文

请问Java_爬虫,怎么抓取Js动态生成数据的页面?

很多网站是用jsJquery 生成数据的,到后台获取到数据以后,用 document.write()或者("#id").html="" 的方式 写到页面中,这个时候用浏览器查看源码是看不到数据的。

HttpClient是不行的,看网上说HtmlUnit,说 可以获取后台js加载完后的完整页面,但是我按照文章上说的 写了 ,都不好使。一般的代码是这样写的:

String url = "http://xinjinqiao.tprtc.com/admin/main/flrpro.do";
        try {
            WebClient webClient = new WebClient(BrowserVersion.FIREFOX_10);
            //设置webClient的相关参数
            webClient.getOptions().setJavaScriptEnabled(true);
            webClient.getOptions().setCssEnabled(false);
            webClient.setAjaxController(new NicelyResynchronizingAjaxController());
            //webClient.getOptions().setTimeout(50000);
            webClient.getOptions().setThrowExceptionOnScriptError(false);
            //模拟浏览器打开一个目标网址
            HtmlPage rootPage = webClient.getPage(url);
            System.out.println("为了获取js执行的数据 线程开始沉睡等待");
            Thread.sleep(3000);//主要是这个线程的等待 因为js加载也是需要时间的
            System.out.println("线程结束沉睡");
            String html = rootPage.asText();
            System.out.println(html);
        } catch (Exception e) {
        }

其实根本不好使。

其中典型的就是这个链接的页面,怎么能在java程序中获取其中的数据?

http://xinjinqiao.tprtc.com/admin/main/flrpro.do

展开
收起
爵霸 2016-03-23 13:35:25 7296 0
1 条回答
写回答
取消 提交回答
问答排行榜
最热
最新

相关电子书

更多
JavaScript异步编程 立即下载
Delivering Javascript to World 立即下载
编程语言如何演化-以JS的private为例 立即下载