基于python的网络爬虫设计.doc

上传人：精***

文档编号：3998042

上传时间：2024-07-24

格式：DOC

页数：5

大小：30.04KB

《基于python的网络爬虫设计.doc》由会员分享，可在线阅读，更多相关《基于python的网络爬虫设计.doc（5页珍藏版）》请在咨信网上搜索。

1、基于python的网络爬虫设计【摘要】近年来，随着网络应用的逐渐扩展和深入,如何高效的获取网上数据成为了无数公司和个人的追求,在大数据时代，谁掌握了更多的数据，谁就可以获得更高的利益,而网络爬虫是其中最为常用的一种从网上爬取数据的手段。网络爬虫,即Web Spider，是一个很形象的名字.如果把互联网比喻成一个蜘蛛网,那么Spider就是在网上爬来爬去的蜘蛛。网络蜘蛛是通过网页的链接地址来寻找网页的.从网站某一个页面(通常是首页）开始，读取网页的内容，找到在网页中的其它链接地址,然后通过这些链接地址寻找下一个网页，这样一直循环下去,直到把这个网站所有的网页都抓取完为止。如果把整个互联网当成一

2、个网站,那么网络蜘蛛就可以用这个原理把互联网上所有的网页都抓取下来。那么，既然网络爬虫有着如此先进快捷的特点，我们该如何实现它呢？在众多面向对象的语言中，首选python，因为python是一种“解释型的、面向对象的、带有动态语义的”高级程序，可以使人在编程时保持自己的风格,并且编写的程序清晰易懂，有着很广阔的应用前景。关键词 python 爬虫数据1 前言1.1本编程设计的目的和意义随着网络的迅速发展,万维网成为大量信息的载体，如何有效地提取并利用这些信息成为一个巨大的挑战。搜索引擎(例如传统的通用搜索引擎AltaVista,Yahoo！和Google等)作为一个辅助人们检索信息的工具

3、成为用户访问万维网的入口和指南。但是,这些通用性搜索引擎也存在着一定的局限性，如： (1）不同领域、不同背景的用户往往具有不同的检索目的和需求，通用搜索引擎所返回的结果包含大量用户不关心的网页。（2）通用搜索引擎的目标是尽可能大的网络覆盖率,有限的搜索引擎服务器资源与无限的网络数据资源之间的矛盾将进一步加深. (3）万维网数据形式的丰富和网络技术的不断发展，图片、数据库、音频/视频多媒体等不同数据大量出现,通用搜索引擎往往对这些信息含量密集且具有一定结构的数据无能为力，不能很好地发现和获取。 (4）通用搜索引擎大多提供基于关键字的检索，难以支持根据语义信息提出的查询。为了解决上述问

4、题，定向抓取相关网页资源的聚焦爬虫应运而生。聚焦爬虫是一个自动下载网页的程序,它根据既定的抓取目标，有选择的访问万维网上的网页与相关的链接，获取所需要的信息。与通用爬虫(generalpurpose web crawler）不同，聚焦爬虫并不追求大的覆盖，而将目标定为抓取与某一特定主题内容相关的网页,为面向主题的用户查询准备数据资源。 1。2编程设计目及思路1.2。1编程设计目的学习了解并熟练掌握python的语法规则和基本使用，对网络爬虫的基础知识进行了一定程度的理解，提高对网页源代码的认知水平，学习用正则表达式来完成匹配查找的工作，了解数据库的用途，学习mongodb数据库的安装和使用，

5、及配合python的工作。1.2.2设计思路（1) 以世纪佳缘网为例，思考自己所需要的数据资源，并以此为基础设计自己的爬虫程序.（2) 应用python伪装成浏览器自动登陆世纪佳缘网,加入变量打开多个网页。（3) 通过python的urllib2函数进行世纪佳缘网源代码的获取.（4) 用正则表达式分析源代码，找到所需信息导入excel.（5) 连接数据库,将爬下的数据存储在数据库中.1。3本编程设计应达到的要求 1、对特定的网站爬取特定的数据； 2、实现代码和得到结果； 3、能够和数据库进行连接，将爬下的数据存储在数据库中。 4、将爬下的数据储存在excel中方便编辑.2 编程设计方案2.1爬

6、取方案2.1.1所需爬取的数据以世纪佳缘网为例,所需要爬取的数据为注册世纪佳缘网的人的用户名、真实姓名、性别、年龄、学历、月收入这些直观信息.2.1.2用python获取世纪佳缘网的源代码爬虫最主要的处理对象就是URL，它根据URL地址取得所需要的文件内容，然后对它进行进一步的处理.因此,准确地理解URL对理解网络爬虫至关重要。URL是URI的一个子集.它是Uniform Resource Locator的缩写,译为“统一资源定位符。通俗地说，URL是Internet上描述信息资源的字符串，主要用在各种WWW客户程序和服务器程序上。采用URL可以用一种统一的格式来描述各种信息资源，包括文件

7、、服务器的地址和目录等。URL的格式由三部分组成:第一部分是协议(或称为服务方式）。第二部分是存有该资源的主机IP地址（有时也包括端口号）。第三部分是主机资源的具体地址,如目录和文件名等。第一部分和第二部分用“:/符号隔开，第二部分和第三部分用“/”符号隔开。第一部分和第二部分是不可缺少的,第三部分有时可以省略。例如:http:/www.rol。cn。net/talk/talk1。htm其计算机域名为。net;超级文本文件(文件类型为。html)是在目录/talk下的talk1。htm。这是瑞得聊天室的地址，可由此进入瑞得聊天室的第1室。Python获取网页源代码可用urllib或urllib

8、2函数进行，极其方便快捷，代码如下:importurllib2response=urllib2.urlopen(http：/html=response。read(）printhtml2。1。3应用python伪装成浏览器自动登陆世纪佳缘网，加入变量打开多个网页. 有了源代码就可以进行数据的爬取了，但是因为世纪佳缘网近日进行了改版,简单的爬虫程序已经无法在对其进行全网页的爬取工作了,所以，在获取数据之前，需要对爬虫进行一下伪装，使其成为一个浏览器,以实现全网页的爬取工作。应用opener和header的基础知识即可实现伪装成浏览器这一步骤.在伪装的同时,需要加入变量来打开多个网页，是的爬取工作

9、可以顺利进行。代码如下：r=0w=3013while 3012w9999： w=w+1 k=str（w） login_page = http:/login。jiayuan。com/dologin。php？pre_url=http：/usercp。jiayuan。com/” cj = cookielib.CookieJar（） opener=urllib2.build_opener(urllib2.HTTPCookieProcessor(cj） opener。addheaders = (User-agent,Mozilla/4.0 （compatible； MSIE 6。0； Windows N

10、T 5。1） data = urllib.urlencode（name”:”834054996qq。com，password”:benben12”） opener.open（login_page，data) op=opener。open（”http：/www。jiayuan。com/10796+k） html=op。read（)2。14用正则表达式分析网页源代码正则表达式是用于处理字符串的强大工具，它并不是Python的一部分。其他编程语言中也有正则表达式的概念，区别只在于不同的编程语言实现支持的语法数量不同。它拥有自己独特的语法以及一个独立的处理引擎，在提供了正则表达式的语言里，正则表达式的

11、语法都是一样的。下图为使用正则表达式进行匹配的流程:正则表达式的大致匹配过程是:1.依次拿出表达式和文本中的字符比较，2.如果每一个字符都能匹配，则匹配成功；一旦有匹配不成功的字符则匹配失败.3。如果表达式中有量词或边界，这个过程会稍微有一些不同。 Python是通过re模块实现对正则表达式的调用的。程序代码如下：find_re = pile(r”absolute.+？span(。?）/.+?gt；gt；。+?/b（。?）/s。+？/b（。?）/s.+?/b（.？）/sp。+?， re。DOTALL） 2。2存储方案 2。2.1储存在excel表格中 Excel表格具有方便筛选、查找和编辑的特

12、点,所以将网络爬虫爬取的数据储存在excel表格中是首选. 使用python建立excel表格是十分容易,代码如下:filename = xlwt。Workbook （)sheet = filename.add_sheet(name）建立完成后可将数据写入excel表格： for a in x： sheet.write（r，0,a0。decode(utf8”） sheet。write（r，1,a1.decode(utf-8”) sheet。write（r，2,a2.decode（”utf-8”)） sheet.write(r,3，a3。decode（utf8） sheet.write（r,4

13、，a4.decode（”utf8） sheet。write（r，5,a5。decode（”utf8)） r=r+1 print r+3012 filename.save（test3.xls） 2。2。2储存在数据库中数据库指的是以一定方式储存在一起、能为多个用户共享、具有尽可能小的冗余度、与应用程序彼此独立的数据集合。将数据储存在数据库中也具有直观简洁的特点。 Python调用数据库是用pymongo模块,创建与导入代码如下：db = pymongo。Connection(）.testfor a in x： values=dict( img=a0。decode（utf8)， infor=a1。

14、decode(utf8”）， age=a2。decode（”utf8）, adress=a3。decode(utf8”）, marry=a4。decode（utf8”) ) db。user。insert（values：values） content = db。user。find（） for a in x: print img：+a0.decode(”utf8”） print infor:+a1。decode（”utf8） print age：+a2.decode（”utf8”） print adress:+a3。decode(”utf-8”） print marry：+a4。decode（”u

15、tf-8)3、总结本程序利用了python语言编写网络爬虫程序，实现了从世纪佳缘网上爬取用户数据资料，使用urllib函数以及re模块、pymongo模块进行源代码的获取、编辑和数据的导出，并针对网页代码中无性别显示的问题，采取爬取注册用户信息同时爬取注册用户照片地址的方式解决，浏览所爬取信息时，只需将照片地址输入浏览器地址栏，即可得到所查看用户上传的自拍照，得到形象信息。总的来说程序设计简便、实用性强、便于读取和再利用。4、附录4.1将爬取数据储存在excel表格4。1。1 源代码coding=gbkimport reimport xlwtimport cookielibimport ur

16、llib,urllib2filename = xlwt.Workbook （)sheet = filename.add_sheet（name）find_re = pile（r”absolute.+?span(.？)/.+？gt；gt;(.*?)/h2。+?/b（。*？)/s.+？/b（。?）/s.+?/b（。？）/sp。+？/b（。？)/sp。+?/b， re.DOTALL） r=0w=3013while 3012w9999： w=w+1 k=str（w） login_page = http：/login。jiayuan。com/dologin.php？pre_url=http：/usercp

17、。jiayuan。com/” cj = cookielib。CookieJar（） opener=urllib2.build_opener（urllib2.HTTPCookieProcessor(cj） opener。addheaders = (Useragent，Mozilla/4。0 （compatible; MSIE 6。0； Windows NT 5。1)） data = urllib。urlencode(name”:”834054996”,”password”:benben12) opener。open（login_page，data) op=opener。open（”http：/

18、html=op。read（) x=find_re。findall(html) for a in x: sheet。write（r，0,a0.decode(”utf-8）) sheet.write（r,1，a1.decode(”utf-8)） sheet.write(r,2,a2。decode（”utf8”） sheet。write（r,3，a3。decode(utf8） sheet。write(r,4，a4。decode（utf8) sheet.write（r，5，a5。decode(utf-8)） r=r+1 print r+3012 filename。save(test3。xls)4.1.

19、2 爬取数据汇总截图4。2将爬取数据写入数据库4。2.1 源代码coding=gbkimport urllibimport reimport pymongodb = pymongo。Connection(）.testfind_re = re。compile(r”absolute.+？span(。*？)/.+？>；gt；/a（。*?).+?(。?）/s。+？/b（.？)/sp。+?/b， re。DOTALL） w=11while 10w20： w=w+1 k=str(w) page=urllib。urlopen(http:/www.jiayuan。com/1079608”+k+”？fxly=

20、search_v2_index） html=page。read（） x=find_re。findall(html） for a in x： values=dict( img=a0。decode(”utf-8”）， infor=a1。decode(”utf-8”), age=a2。decode（utf-8”）, adress=a3。decode（”utf8”）, marry=a4.decode(utf8） ) db。user。insert（values：values) content = db。user。find（） for a in x： print img：+a0.decode（”utf8”) print infor:+a1。decode(”utf-8） print age:+a2。decode(”utf8”) print adress：+a3。decode（”utf-8) print marry:+a4.decode（”utf-8”)4。2。2 爬取数据汇总截图参考文献（1） Guido van rossum Python手册（2） Magnus Lie Hetlar python基础教程（3）罗刚，王振东自己动手写网络爬虫

文档加载中……请稍候！
如果长时间未打开，您也可以点击刷新试试。

下载文档保存到电脑，查找使用更方便

6 金币 0人已下载

申诉本文档由用户提供并上传，收益归属内容提供方，若内容存在侵权，请申请举报、认领或删除 立即下载

配套讲稿：: 如PPT文件的首页显示word图标，表示该PPT已包含配套word讲稿。双击word图标可打开word文档。
特殊限制：: 部分文档作品中含有的国旗、国徽等图片，仅作为作品整体效果示例展示，禁止商用。设计者仅对作品中独创性部分享有著作权。
关键词：: 基于 python 网络爬虫设计

咨信网温馨提示：
1、咨信平台为文档C2C交易模式，即用户上传的文档直接被用户下载，收益归上传人（含作者）所有；本站仅是提供信息存储空间和展示预览，仅对用户上传内容的表现方式做保护处理，对上载内容不做任何修改或编辑。所展示的作品文档包括内容和图片全部来源于网络用户和作者上传投稿，我们不确定上传用户享有完全著作权，根据《信息网络传播权保护条例》，如果侵犯了您的版权、权益或隐私，请联系我们，核实后会尽快下架及时删除，并可随时和客服了解处理情况，尊重保护知识产权我们共同努力。
2、文档的总页数、文档格式和文档大小以系统显示为准(内容中显示的页数不一定正确)，网站客服只以系统显示的页数、文件格式、文档大小作为仲裁依据，个别因单元格分列造成显示页码不一将协商解决，平台无法对文档的真实性、完整性、权威性、准确性、专业性及其观点立场做任何保证或承诺，下载前须认真查看，确认无误后再购买，务必慎重购买；若有违法违纪将进行移交司法处理，若涉侵权平台将进行基本处罚并下架。
3、本站所有内容均由用户上传，付费前请自行鉴别，如您付费，意味着您已接受本站规则且自行承担风险，本站不进行额外附加服务，虚拟产品一经售出概不退款（未进行购买下载可退充值款），文档一经付费（服务费）、不意味着购买了该文档的版权，仅供个人/单位学习、研究之用，不得用于商业用途，未经授权，严禁复制、发行、汇编、翻译或者网络传播等，侵权必究。
4、如你看到网页展示的文档有www.zixin.com.cn水印，是因预览和防盗链等技术需要对页面进行转换压缩成图而已，我们并不对上传的文档进行任何编辑或修改，文档下载后都不会有水印标识（原文档上传前个别存留的除外），下载后原文更清晰；试题试卷类文档，如果标题没有明确说明有答案则都视为没有答案，请知晓；PPT和DOC文档可被视为“模板”，允许上传人保留章节、目录结构的情况下删减部份的内容；PDF文档不管是原文档转换或图片扫描而得，本站不作要求视为允许，下载前自行私信或留言给上传者【精***】。
5、本文档所展示的图片、画像、字体、音乐的版权可能需版权方额外授权，请谨慎使用；网站提供的党政主题相关内容(国旗、国徽、党徽－－等)目的在于配合国家政策宣传，仅限个人学习分享使用，禁止用于任何广告和商用目的。
6、文档遇到问题，请及时私信或留言给本站上传会员【精***】，需本站解决可联系【微信客服】、【 QQ客服】，若有其他问题请点击或扫码反馈【服务填表】；文档侵犯商业秘密、侵犯著作权、侵犯人身权等，请点击“【版权申诉】”（推荐），意见反馈和侵权处理邮箱：1219186828@qq.com；也可以拔打客服电话：4008-655-100；投诉/维权电话：4009-655-100。

关于本文

本文标题：基于python的网络爬虫设计.doc
链接地址：https://www.zixin.com.cn/doc/3998042.html

精***

内容提供者

实名认证

查看上传人更多文档

部分上传会员的收益排行 01、路***（￥15400+），
02、曲****（￥15300+），
03、wei****016（￥13200+）,
04、大***流（￥12600+），
05、Fis****915（￥4200+），
06、h****i（￥4100+），
07、Q**（￥3400+），
08、自******点（￥2400+），
09、h*****x（￥1400+），
10、c****e（￥1100+）,
11、be*****ha（￥800+），
12、13********8（￥800+）。

相似文档

自信AI助手