产品中心
联系我们
电话:010-69946594
传真:010-69946594
邮箱:18311023120@126.com
地址:北京市海淀区中关村创业大街昊海楼7层
网络爬虫
发布时间:2017-12-05 来源:北京青星教育科技股份公司
网络爬虫(又被称为网页蜘蛛,网络机器人,在FOAF社区中间,更经常的称为网页追逐者),是一种按照一定的规则,自动地抓取万维网信息的程序或者脚本。另外一些不常使用的名字还有蚂蚁、自动索引、模拟程序或者蠕虫。
这些处理被称为网络抓取或者蜘蛛爬行。很多站点,尤其是搜索引擎,都使用爬虫提供最新的数据,它主要用于提供它访问过页面的一个副本,然后,搜索引擎就可以对得到的页面进行索引,以提供快速的访问。蜘蛛也可以在web上用来自动执行一些任务,例如检查链接,确认html代码;也可以用来抓取网页上某种特定类型信息,例如抓取电子邮件地址(通常用于垃圾邮件)。
一个网络蜘蛛就是一种机器人,或者软件代理。大体上,它从一组要访问的URL链接开始,可以称这些URL为种子。爬虫访问这些链接,它辨认出这些页面的所有超链接,然后添加到这个URL列表,可以称作检索前沿。这些URL按照一定的策略反复访问。
这些处理被称为网络抓取或者蜘蛛爬行。很多站点,尤其是搜索引擎,都使用爬虫提供最新的数据,它主要用于提供它访问过页面的一个副本,然后,搜索引擎就可以对得到的页面进行索引,以提供快速的访问。蜘蛛也可以在web上用来自动执行一些任务,例如检查链接,确认html代码;也可以用来抓取网页上某种特定类型信息,例如抓取电子邮件地址(通常用于垃圾邮件)。
一个网络蜘蛛就是一种机器人,或者软件代理。大体上,它从一组要访问的URL链接开始,可以称这些URL为种子。爬虫访问这些链接,它辨认出这些页面的所有超链接,然后添加到这个URL列表,可以称作检索前沿。这些URL按照一定的策略反复访问。
相关新闻
更多
-
颠覆!美国这一大消息,整个金融圈都炸了! 【2017-11-23】
面对步步逼近的人工智能,你有三个选择: 1、要么积累财富,成为资本大鳄 2、积累名气,成为独特个体 3、积累知识,成为更高深技术的掌握者
-
传统专业+大数据人工智能培养计划 【2017-11-23】
青星教育是在教育部、工信部相关领导的关怀下,依托北京大学计算机科学技术系,由知名天使投资、著名教育界人士、资深互联网技术大咖共同投资创建,于2016年10月在中关村创业大街成立的股份制公司,注册资本500万元。同年入驻北京大学校友创业训练营。
-
发现所学专业不好就业,如何找到自己的方向? 【2017-11-23】
说说我自己吧。 高考不理想,调剂到一个我猜多数人都没听说过的专业----植物保护。确实,听名字也挺不好就业的。加上对这个专业实在是没兴趣,大一下学期通过转专业考试转了系。当时只是盲目的想逃离原专业.
相关产品
更多