C#+HtmlAgilityPack+Dapper走一波爬虫 - 山治先生

link管理

链接快照平台

输入网页链接，自动生成快照
标签化管理网页链接

相关文章推荐

俊逸的米饭 · Spring) Poi와 Jxls를 ...· 5 天前 ·

飞奔的柚子 · 如何使用XWPF - Apache ...· 5 天前 ·

心软的香菜 · Lua-Source-Internal/do ...· 2 周前 ·

考研的蚂蚁 · 建筑试题《材料力学》考试题库无答案（二）.d ...· 3 周前 ·

活泼的砖头 · AutoDock-GPU版本安装-报错！_a ...· 1 月前 ·

狂野的炒饭 · GitHub - ...· 2 月前 ·

路过的洋葱 · 马克思与诺斯的意识形态理论比较研究 -- ...· 3 月前 ·

打篮球的啄木鸟 · How To Checkout/Clone ...· 3 月前 ·

坏坏的莴苣 · 联想拯救者R7000P 2021开启预约 ...· 3 月前 ·

低调的绿茶 · dvd转换器|DVD转MP4转换器|DVD转 ...· 4 月前 ·

最近因为公司业务需要，又有机会撸winform了，这次的需求是因为公司有项目申报的这块业务，项目申报前期需要关注政府发布的相关动态信息，政府部门网站过多，人工需要一个一个网站去浏览和查阅，有时候还会遗漏掉，因此呢，我们打算用爬虫+移动端web来做，我主要负责爬虫和web Api。

爬虫主要采用.Net强大的开源解析HTML元素的类库HtmlAgilityPack，操作过XML的童鞋应该很快就可以上手，通过分析XPath来解析HTML，非常的方便的，还有一款不错的叫Jumony，没用过，对HtmlAgilityPack比较熟悉，所以首选了HtmlAgilityPack来作为主力军。

HtmlAgilityPack的基本使用可以参考这篇《开源项目Html Agility Pack实现快速解析Html 》。

效果图，多图慎入：

采集广西财政厅例子

因为是政府发布的出来的信息，所以信息的对外开放的，只是机器代替人工来浏览，不会被和谐的，主要采集文章的标题、日期和文章内容，以广西财政厅网站为例子。

First

加载网站这个就不用说了，先查看网站的字符编码，如图 <meta http-equiv="Content-Type" content="text/html; charset=utf-8" /> ，然后设置HtmlAgilityPack中的 OverrideEncoding 属性，再开始加载，不然采集到的是乱码，没有意义。

htmlAgilityPack.OverrideEncoding = Encoding.UTF8;

Second

分析文章列表，浏览器F12查看HTML标签情况，可以分析出XPath为：

//ul[@class='dzjzw_list_main_ul']//li

文章内容的链接的XPath标签：

文章发布的时间XPath标签：

//span[@class='date']

示例流程代码：

//获取第一页的内容
HtmlNode  row = GetHtmlDoc(htmlWeb, url);
//根据xpath获取列表
var list = row.SelectNodes("//ul[@class='dzjzw_list_main_ul']//li");
 foreach (var data in list)
      HtmlNode node = HtmlNode.CreateNode(data.OuterHtml);
      HtmlNode a = node.SelectSingleNode("//a");
      HtmlNode date = node.SelectSingleNode("//span['date']");
/// <summary>
/// 这里偶尔会浏览网页失败的，所以失败了多浏览几次
/// </summary
public static HtmlNode GetHtmlDoc(HtmlWeb htmlWeb, string url)
                var doc = GetDoc(htmlWeb, url);
                if (doc == null)
                    int againIdx = 0;
                    while (againIdx++ < 5)
                        System.Threading.Thread.Sleep(1000);
                        doc = GetDoc(htmlWeb, url);
                        if (doc != null)
                            break;
                    if (doc == null)
                        var htmlData = HttpHelper.Get<string>(url).Result;//.GetStringAsync(url).Result;
                        return HtmlNode.CreateNode(htmlData);
                        return doc.DocumentNode;
                return doc.DocumentNode;
            catch
                Log.Error("未能正确访问地址：" + url);
                return null;
/// <summary>
/// 加载网页
/// </summary>
public static HtmlDocument GetDoc(HtmlWeb htmlWeb, string url)
                return htmlWeb.Load(url);
            catch (Exception ex)
                return null;
都可以使用 HtmlNode.InnerText 来获取到相关值，非常的方便。
Third
　　　　文章详细内容也如此，通过分析XPath来分析即可，最头疼的是翻页的问题，因为政府网站使用的技术一般都是比较那个的，你懂的，有些使用到oncilck来触发的，有些表单提交，要具体问题具体分析了，用Fiddler和浏览器的F12大法来分析翻页数据来源，在这里的例子翻页也比较简单，通过拼接URL来进行翻页即可。
Fourth
　　　　爬取到的之后，再来一个钉钉通知，在群里拉入一个机器人，可以参考钉钉的开发文档。
　　　　这样我们爬取的消息就第一时间通知到群里的小伙伴啦，是不是很炫酷，哈哈哈。 
　　　　项目demo已经上传，仅供学习
　　　　码云：https://gitee.com/Backgrounder/Spider

　　　　Git：https://github.com/EminemJK/Spider
　　　　评论区有提问说部分网站是动态渲染数据的，用XPath分析不到结果，如果数据不是来源于当前界面的HTML，那XPath是分析不到，这时候你需要看它的数据源来自哪里，用Fiddler或者浏览器F12抓一下数据源，类似这个网站（http://www.nnhrss.gov.cn/ecdomain/framework/nnrsw/djiaakgphfalbboelieaiobfgheoldlc.jsp），
查看好数据源，分析出它的数据源来自这个：
（http://www.nnhrss.gov.cn/ecdomain/portal/portlets/newslist/newslistcomponent.jsp?goPage=1&pageNum=1&siteID=nnrsw&pageID=djiaakgphfalbboelieaiobfgheoldlc&moduleID=djichlhahfalbboelieaiobfgheoldlc&moreURI=/ecdomain/framework/nnrsw/djiaakgphfalbboelieaiobfgheoldlc/djichlhahfalbboelieaiobfgheoldlc.do&var_temp=eobjphbogdcnbboekapmnnfcbdankadp&currfolderid=null&showChildFlag=false&displayPageLinkFlag=true），
再用xpath直接对数据源分析即可。
————————————————————————————————————————————————————————————————————
根据评论区的大神也提供了其他好用的爬虫库，了解一下：
1> 一线码农  　　node+cheerio
2>newjajk  　　   Chromedriver
3>ZUOXIANGE   anglesharp
本文已独家授权给脚本之家（ID:jb51net）公众号发布