笨笨图片批量抓取下载 V0.2 beta[C# | WinForm | 正则表达式 | HttpWebRequest | Async异步编程]

简介:

一.     先贴一张图,这个界面就是程序的主界面了:

     

 二.     部分代码说明(主要讲解异步分析和下载):

          异步分析下载采取的策略是同时分析同时下载,即未等待数据全部分析完毕就开始把已经分析出来的图片链接开始下载。下载成功的均在List框链接前面划上了 ,未能下载的图片有可能是分析错误或者是下载异常。

         1.     异步分析部分代码

         ///   <summary>
        
///  异步分析下载
        
///   </summary>
         private   void  AsyncAnalyzeAndDownload( string  url,  string  savePath)
        {
            
this .uriString  =  url;
            
this .savePath  =  savePath;

            
#region  分析计时开始

            count 
=   0 ;
            count1 
=   0 ;
            freq 
=   0 ;
            result 
=   0 ;

            QueryPerformanceFrequency(
ref  freq);
            QueryPerformanceCounter(
ref  count);

            
#endregion

            
using  (WebClient wClient  =   new  WebClient())
            {
                AutoResetEvent waiter 
=   new  AutoResetEvent( false );
                wClient.Credentials 
=  CredentialCache.DefaultCredentials;
                wClient.DownloadDataCompleted 
+=   new  DownloadDataCompletedEventHandler(AsyncURIAnalyze);
                wClient.DownloadDataAsync(
new  Uri(uriString), waiter);
                
// waiter.WaitOne();      // 阻止当前线程,直到收到信号
            }
                
        }

        
///   <summary>
        
///  异步分析
        
///   </summary>
         protected   void  AsyncURIAnalyze(Object sender, DownloadDataCompletedEventArgs e)
        {
            AutoResetEvent waiter 
=  (AutoResetEvent)e.UserState;
            
try
            {
                
if  ( ! e.Cancelled  &&  e.Error  ==   null )
                {
                    
                    
string  dnDir  =   string .Empty;
                    
string  domainName  =   string .Empty;
                    
string  uri  =  uriString;

                    
// 获得域名  http://www.sina.com/
                    Match match  =  Regex.Match(uri,  @" ((http(s)?://)?)+[\w-.]+[^/] " ); // , RegexOptions.IgnoreCase
                    domainName  =  match.Value;

                    
// 获得域名最深层目录  http://www.sina.com/mail/
                     if  (domainName.Equals(uri))
                        dnDir 
=  domainName;
                    
else
                        dnDir 
=  uri.Substring( 0 , uri.LastIndexOf( ' / ' ));

                    dnDir 
+=   ' / ' ;
                    
                    
// 获取数据
                     string  pageData  =  Encoding.UTF8.GetString(e.Result);
                    List
< string >  urlList  =   new  List < string > ();

                    
// 匹配全路径
                    match  =  Regex.Match(pageData,  @" ((http(s)?://)?)+(((/?)+[\w-.]+(/))*)+[\w-./]+\.+( "   +  ImageType  +   " ) " );  // , RegexOptions.IgnoreCase
                     while  (match.Success)
                    {
                        
string  item  =  match.Value;
                        
// 短路径处理
                         if  (item.IndexOf( " http:// " ==   - 1   &&  item.IndexOf( " https:// " ==   - 1 )
                            item 
=  (item[ 0 ==   ' / '   ?  domainName : dnDir)  +  item;

                        
if  ( ! urlList.Contains(item))
                        {
                            urlList.Add(item);
                            imgUrlList.Add(item);

                            
// 实时显示分析结果
                            AddlbShowItem(item);

                            
// 边分析边下载
                            WebRequest hwr  =  WebRequest.Create(item);
                            hwr.BeginGetResponse(
new  AsyncCallback(AsyncDownLoad), hwr);
                            
// hwr.Timeout = "0x30D40";         // 默认 0x186a0 -> 100000 0x30D40 -> 200000
                            
// hwr.Method = "POST";
                            
// hwr.ContentType = "application/x-www-form-urlencoded";
                            
// hwr.MaximumAutomaticRedirections = 3;
                            
// hwr.Accept ="image/gif, image/x-xbitmap, image/jpeg, image/pjpeg, application/x-shockwave-flash, application/vnd.ms-excel, application/vnd.ms-powerpoint, application/msword, */*";
                            
// hwr.Accept = "image/gif, image/x-xbitmap, image/jpeg, image/pjpeg, */*";
                            
// IAsyncResult iar = hwr.BeginGetResponse(new AsyncCallback(AsyncDownLoad), hwr);
                            
// iar.AsyncWaitHandle.WaitOne();
                        }
                        match 
=  match.NextMatch();
                    }
                }
            }
            
finally
            {
                waiter.Set();

                
#region  分析计时结束

                QueryPerformanceCounter(
ref  count1);
                count 
=  count1  -  count;
                result 
=  ( double )(count)  /  ( double )freq;

                toolStripStatusLabel1.Text 
=   " 分析完毕! " ;
                toolStripStatusLabel2.Text 
=   string .Format( "  | 分析耗时:{0}秒 " , result);
                Application.DoEvents();

                
#endregion

                
// 分析完毕
                isAnalyzeComplete  =   true ;
            }
        }

     这两个方法主要是用WebClient来请求然后异步获得网址所返回的数据并对数据分析,提取图片链接,提取主要有两种方式:一种是完整路径的图片链接;一种是短路径的链接,比如/images/bg.gif,程序会自动为其加上域名部分组成完整的链接。

2.     异步下载部分代码

         ///   <summary>
        
///  异步接受数据
        
///   </summary>
        
///   <param name="asyncResult"></param>
         public    void  AsyncDownLoad(IAsyncResult asyncResult)  
        {
            
#region  下载计时开始

            
if  (cfreq  ==   0 )
            {
                QueryPerformanceFrequency(
ref  cfreq);
                QueryPerformanceCounter(
ref  ccount);
            }

            
#endregion

            WebRequest request 
=  (WebRequest)asyncResult.AsyncState;
            
string  url  =  request.RequestUri.ToString();
            
try
            {
                WebResponse response 
=  request.EndGetResponse(asyncResult);
                
using  (Stream stream  =  response.GetResponseStream())
                {
                    Image img 
=  Image.FromStream(stream);
                    
string [] tmpUrl  =  url.Split( ' . ' );
                    img.Save(
string .Concat(savePath,  " / " , DateTime.Now.ToString( " yyyyMMddHHmmssfff " ),  " . " , tmpUrl[tmpUrl.Length  -   1 ]));
                    img.Dispose();
                    stream.Close();
                }
                allDone.Set();

                
// 从未下载的列表中删除已经下载的图片
                imgUrlList.Remove(url);

                
// 更新列表框
                 int  indexItem  =   this .lbShow.Items.IndexOf(url);
                
if  (indexItem  >=   0   &&  indexItem  <=   this .lbShow.Items.Count)
                    SetlbShowItem(indexItem);
            }
            
catch  (Exception)
            {
                imgUrlList.Remove(url);
            }
        }

     这部分就是异步下载图片并保存的代码,调用部分请看AsyncURIAnalyze方法分析图片链接匹配成功后就开始进行图片下载,每下载完一张图片就更新显示在界面正下方List框内(在链接前标记 )。

     篇幅有限,还有一起其他重要的代码如 实时显示分析和下载结果 的代码请下载源代码查看。另外需要注意的是输入需要下载图片的网址的时候需要输入完整的链接,带http如http://www.sina.com/ 。

程序和代码:

     exe可执行文件:http://files.cnblogs.com/over140/IBD_exe.rar

     源代码:http://files.cnblogs.com/over140/ImagesBatchDownloading2008-8-21.rar

本文转自博客园农民伯伯的博客,原文链接:笨笨图片批量抓取下载 V0.2 beta[C# | WinForm | 正则表达式 | HttpWebRequest | Async异步编程],如需转载请自行联系原博主。

目录
相关文章
|
3月前
|
数据采集 JavaScript C#
C#图像爬虫实战:从Walmart网站下载图片
C#图像爬虫实战:从Walmart网站下载图片
|
4月前
|
数据采集 存储 C#
C# 爬虫技术:京东视频内容抓取的实战案例分析
C# 爬虫技术:京东视频内容抓取的实战案例分析
|
4月前
|
数据采集 XML JavaScript
C# 中 ScrapySharp 的多线程下载策略
C# 中 ScrapySharp 的多线程下载策略
|
1月前
|
C# UED SEO
C# 异步方法async / await任务超时处理
通过使用 `Task.WhenAny`和 `Task.Delay`方法,您可以在C#中有效地实现异步任务的超时处理机制。这种方法允许您在指定时间内等待任务完成,并在任务超时时采取适当的措施,如抛出异常或执行备用操作。希望本文提供的详细解释和代码示例能帮助您在实际项目中更好地处理异步任务超时问题,提升应用程序的可靠性和用户体验。
73 3
|
2月前
|
监控 前端开发 安全
C#一分钟浅谈:文件上传与下载功能实现
【10月更文挑战第2天】在Web应用开发中,文件的上传与下载是常见需求。本文从基础入手,详细讲解如何在C#环境下实现文件上传与下载。首先介绍前端表单设计及后端接收保存方法,使用`&lt;input type=&quot;file&quot;&gt;`与`IFormFile`接口;接着探讨错误处理与优化策略,如安全性验证和路径管理;最后讲解文件下载的基本步骤,包括确定文件位置、设置响应头及发送文件流。此外,还提供了进阶技巧,如并发处理、大文件分块上传及进度监控,帮助开发者构建更健壮的应用系统。
158 15
|
3月前
|
SQL API 定位技术
基于C#使用winform技术的游戏平台的实现【C#课程设计】
本文介绍了基于C#使用WinForms技术开发的游戏平台项目,包括项目结构、运行截图、实现功能、部分代码说明、数据库设计和完整代码资源。项目涵盖了登录注册、个人信息修改、游戏商城列表查看、游戏管理、用户信息管理、数据分析等功能。代码示例包括ListView和ImageList的使用、图片上传、图表插件使用和SQL工具类封装,以及高德地图天气API的调用。
基于C#使用winform技术的游戏平台的实现【C#课程设计】
|
2月前
|
设计模式 程序员 C#
C# 使用 WinForm MDI 模式管理多个子窗体程序的详细步骤
WinForm MDI 模式就像是有超能力一般,让多个子窗体井然有序地排列在一个主窗体之下,既美观又实用。不过,也要小心管理好子窗体们的生命周期哦,否则一不小心就会出现一些意想不到的小bug
228 0
|
2月前
|
API C# Windows
【C#】在winform中如何实现嵌入第三方软件窗体
【C#】在winform中如何实现嵌入第三方软件窗体
142 0
|
2月前
|
API C#
C#实现Winform程序右下角弹窗消息提示
C#实现Winform程序右下角弹窗消息提示
136 0
|
4月前
|
关系型数据库 Java MySQL
C#winform中使用SQLite数据库
C#winform中使用SQLite数据库
213 3
C#winform中使用SQLite数据库