php 抓取网站图片的简单程序

简介:
PHP下载CSS文件中的图片
Java代码   收藏代码
  1. <?  
  2. function getImagesFromCssFile() {  
  3. //note 设置PHP超时时间  
  4.     set_time_limit(0);  
  5.   
  6. //note 取得样式文件内容  
  7.     $styleFileContent = file_get_contents('images/style.css');  
  8.   
  9. //note 匹配出需要下载的URL地址  
  10.     preg_match_all("/url\(.+?\)/", $styleFileContent, $imagesURLArray);  
  11.   
  12. //note 循环需要下载的地址,逐个下载  
  13.     $imagesURLArray = array_unique($imagesURLArray[0]);  
  14.     foreach ($imagesURLArray as $imagesURL) {  
  15.         $imagesURL = str_ireplace(array("url("")""'",'"'), '', $imagesURL);  //url(" ") url('')  
  16.         if (preg_match('/^http.*/', $imagesURL)) {   //跳过网络图片  
  17.             continue;  
  18.         }  
  19.         file_put_contents(basename($imagesURL), file_get_contents($imagesURL));  
  20.     }  
  21. }  

 

Java代码   收藏代码
  1. <?php  
  2. /*完成网页内容捕获功能*/  
  3. function get_img_url($site_name) {  
  4.     $site_fd = fopen($site_name, "r");  
  5.     $site_content = "";  
  6.     while (!feof($site_fd)) {  
  7.         $site_content .= fread($site_fd, 1024);  
  8.     }  
  9.     /*利用正则表达式得到图片链接*/  
  10.     $reg_tag = '/<img.*?\"([^\"]*(jpg|bmp|jpeg|gif)).*?>/';  
  11.     $ret = preg_match_all($reg_tag, $site_content, $match_result);  
  12.     fclose($site_fd);  
  13.     return $match_result[1];  
  14. }  
  15.   
  16. /* 对图片链接进行修正 */  
  17. function revise_site($site_list, $base_site) {  
  18.     foreach ($site_list as $site_item) {  
  19.         if (preg_match('/^http/', $site_item)) {  
  20.             $return_list[] = $site_item;  
  21.         } else {  
  22.             $return_list[] = $base_site . "/" . $site_item;  
  23.         }  
  24.     }  
  25.     return $return_list;  
  26. }  
  27.   
  28. /*得到图片名字,并将其保存在指定位置*/  
  29. function get_pic_file($pic_url_array, $pos) {  
  30.     $reg_tag = '/.*\/(.*?)$/';  
  31.     $count = 0;  
  32.     foreach ($pic_url_array as $pic_item) {  
  33.         $ret = preg_match_all($reg_tag, $pic_item, $t_pic_name);  
  34.         $pic_name = $pos . $t_pic_name[1][0];  
  35.         $pic_url = $pic_item;  
  36.         print("Downloading " . $pic_url . "\n");  
  37.         $img_read_fd = fopen($pic_url, "r");  
  38.         $img_write_fd = fopen($pic_name, "w");  
  39.         $img_content = "";  
  40.         while (!feof($img_read_fd)) {  
  41.             $img_content .= fread($img_read_fd, 1024);  
  42.   
  43.         }  
  44.         fwrite($img_write_fd, $img_content);  
  45.         fclose($img_read_fd);  
  46.         fclose($img_write_fd);  
  47.         print("[OK]\n");  
  48.     }  
  49.     return 0;  
  50. }  
  51.   
  52. function main() {  
  53.     /* 待抓取图片的网页地址 */  
  54.     $site_name = "http://image.cn.yahoo.com";  
  55.     $img_url = get_img_url($site_name);  
  56.     $img_url_revised = revise_site($img_url, $site_name);  
  57.     $img_url_unique = array_unique($img_url_revised); //unique array  
  58.     get_pic_file($img_url_unique, "./");  
  59. }  
  60.   
  61. main();  
  62. ?>  

此程序略有不足,如果图片在网站服务器上不同目次下但文件名是相同的,此时图片有可能是不一样的,但在最后生存时,后面得到的图片会将前边已生存的图片覆 盖掉,如在http://example.com/网站上有图片链接http://example.com/pic/test1.jpg和http: //example.com/pic/new/test1.jpg那么在下载时这两张图片只有一张生存,另外一张就被覆盖掉,修正的方法是在每派生的存前 先检索当前目次下是否已有此文件名,有的话对将派生的存的图片从头命名即可。

Java代码   收藏代码
  1. <?php  
  2. //取得页面所有的图片地址  
  3.   
  4. function getimages($str){  
  5.   
  6.     $match_str = "/((http://)+([^ rn()^$!`"'|[]{}<>]*)((.gif)|(.jpg)|(.bmp)|(.png)|(.GIF)|(.JPG)|(.PNG)|(.BMP)))/";  
  7.   
  8.     preg_match_all ($match_str,$str,$out,PREG_PATTERN_ORDER);  
  9.   
  10.     return $out;  
  11.   
  12. }?>  
相关文章
|
2月前
|
数据采集 人工智能 程序员
PHP 程序员如何为 AI 浏览器(如 ChatGPT Atlas)优化网站
OpenAI推出ChatGPT Atlas,标志AI浏览器新方向。虽未颠覆现有格局,但为开发者带来新机遇。PHP建站者需关注AI爬虫抓取特性,优化技术结构(如SSR、Schema标记)、提升内容可读性与语义清晰度,并考虑未来agent调用能力。通过robots.txt授权、结构化数据、内容集群与性能优化,提升网站在AI搜索中的可见性与引用机会,提前布局AI驱动的流量新格局。
132 8
|
12月前
|
前端开发 关系型数据库 MySQL
PHP外链网盘系统网站源码
> 本文将详细介绍如何从零构建一个基于PHP和MySQL的文件管理系统,分解项目代码并剖析每个模块的功能。我们将以`index.php`、`config.php`和`api.php`这三个核心文件为例,详细展示如何设计文件列表、数据库配置和文件上传接口,从而实现一个完整的文件管理系统。该文章可以作为学术研究和代码实现的参考。
500 98
|
11月前
|
关系型数据库 MySQL PHP
免登录游客卡密发放系统PHP网站源码
这是一个简单易用的卡密验证系统,主要功能包括: 卡密管理和验证,多模板支持,响应式设计,验证码保护,防刷机制,简洁的用户界面, 支持自定义模板,移动端优化,安全性保护,易于部署和维护。
594 77
|
12月前
|
Linux PHP 数据安全/隐私保护
2024授权加密系统PHP网站源码
2024授权加密系统PHP网站源码
332 58
|
10月前
|
PHP
2025简约的打赏系统PHP网站源码
2025简约的打赏系统PHP网站源码
295 20
|
数据采集 JSON JavaScript
如何通过PHP爬虫模拟表单提交,抓取隐藏数据
本文介绍了如何使用PHP模拟表单提交并结合代理IP技术抓取京东商品的实时名称和价格,特别是在电商大促期间的数据采集需求。通过cURL发送POST请求,设置User-Agent和Cookie,使用代理IP绕过限制,解析返回数据,展示了完整代码示例。
278 3
如何通过PHP爬虫模拟表单提交,抓取隐藏数据
|
关系型数据库 MySQL PHP
PHP与MySQL的无缝集成:构建动态网站的艺术####
本文将深入探讨PHP与MySQL如何携手合作,为开发者提供一套强大的工具集,以构建高效、动态且用户友好的网站。不同于传统的摘要概述,本文将以一个生动的案例引入,逐步揭示两者结合的魅力所在,最终展示如何通过简单几步实现数据驱动的Web应用开发。 ####
|
SQL 前端开发 PHP
如何使用PHP开发一个购物网站?
在数字化时代,线上购物日益重要。本文介绍如何使用PHP开发一个功能完善、用户友好的购物网站,涵盖需求分析、开发环境选择、数据库设计、前后端开发、用户认证、商品展示、购物车、订单管理、功能扩展及安全性能优化等环节,旨在提供全面的开发指南。
254 3
|
PHP
20241125易支付PHP网站源码
PHP74,上传源码后解压访问域名/install 进行安装 安装完成 之后一定要设置伪静态 源码里面nginx.txt 就是伪静态 然后复制粘贴到伪静态里面保存即可
341 2
|
数据采集 JavaScript 网络安全
为什么PHP爬虫抓取失败?解析cURL常见错误原因
豆瓣电影评分是电影市场的重要参考,通过网络爬虫技术可以高效采集评分数据,帮助电影制作和发行方优化策略。本文介绍使用PHP cURL库和代理IP技术抓取豆瓣电影评分的方法,解决反爬机制、网络设置和数据解析等问题,提供详细代码示例和优化建议。
457 0
为什么PHP爬虫抓取失败?解析cURL常见错误原因