这就是搜索引擎

张俊林

出版时间

2011-12-31

ISBN

9787121148651

评分

★★★★★

标签

算法

书籍介绍
翻开这本书,你会发现它并不打算把你培养成搜索引擎工程师。多位读者的真实反馈指向一个清晰的定位:这是一本为入门者、转方向的研究者,乃至非码农准备的“扫盲地图”。它把爬虫、索引、排序、链接分析这些庞杂子系统,拆解成“更全、更快、更准”三个目标串起来讲,读起来相对流畅,一天集中啃完并不吃力。正因如此,它也招来争议:对业内人而言内容像“该知道的都知道了”,部分讲解止步于概念;装帧与排版被批评为技术书里的异类。但换个角度,正是这种不端着的态度,让它成为少数能让人轻松读懂中文搜索引擎科普。它适合那些想快速建立整体认知、又懒得四处拼凑资料的人,而不适合寻求深度技术细节的从业者。
作者简介
张俊林:本科毕业于天津大学管理学院,2004年于中科院软件所直接获得博士学位并留所从事科研工作,研究方向为搜索引擎与自然语言处理。2005年在CSDN博客发布系列博文“搜索引擎设计实用教程:以百度为例”,在网络上获得了广泛转载与良好口碑。2006年作为联合创始人建立了智能信息聚合网站“玩聚网”,曾先后于阿里巴巴搜索技术中心任资深搜索技术研究员、房价网首席研究员,现任职于新浪微博,从事微博搜索与语义分析及推荐方面的研发工作。
AI导读
核心看点
  • 全面解析爬虫、索引、排序等搜索引擎核心技术架构
  • 图文并茂,用通俗语言讲解复杂算法,降低理解门槛
  • 涵盖云计算、反作弊等前沿技术,展望搜索未来方向
读者共识
  • 内容通俗易懂,是难得的搜索引擎入门科普佳作
  • 能帮读者将零散知识点串联成系统化的技术框架
  • 虽被指隔靴搔痒,但作为综述索引价值极高
精彩摘录
  • "1995年是搜索引擎商业公司发展的重要起点, 其对应的背景是: 互联网上的Web站点数量首次超过100万, 此时普通用户已无法依赖手工浏览的方式来获得自己想要的信息, 在这一年产生了很多风云一时的早期搜索引擎公司. Yahoo, InfoSeek, Fast Search, AltaVista, Excite等曾经非常著名的搜索引擎公司都创建于1995年"
  • "文本检索的一代使用经典的信息检索模型, 如布尔模型,向量空间模型或概率模型, 来计算用户查选关键词和网页文本内容的相关程度. 网页之间有丰富的链接关系, 而这一代搜索引擎并未使用这些信息. 目前几乎所有的商业搜索引擎都采取了链接分析技术"
  • "查询的平均长度是2.7个单词"
  • "从某种角度看, 链接分析之所以能够改善搜索结果,可以认为是对信息的可信赖度做出的评判, 返回重要网页即可信赖网页"
  • "选取一部分网页作为种子URL, 放入待抓取队列, 爬虫从此队列依次读取, 并将URL通过DNS解析, 将链接地址转换为IP, 然后将其和网页相对路径名称交给网页下载器, 网页下载器负责页面内容下载. 下载到本地的网页一方面将其存储到页面库中, 等待建立索引等后续处理, 另一方面将下载网页的URL放入已抓取URL队列中, 以避免重复抓取. 对于刚下载的网页, 从中抽取出所包含的所有链接信息. 并在已抓取URL队列中检查, 如发现链接还没有被抓取过, 则将其放入待抓取队列末尾. 在之后的抓取调度中会下载这个URL对应的网页. 循环直到待抓取URL队列为空"
  • "友好性: 保护网站部分私密, 减少被抓取网站的网络负载"
  • "暗网爬虫的目的是将暗网数据从数据库中挖掘出来,并将其加入搜索引擎的索引,这样用户在搜索时可以利用这些数据"
目录
目 录
第1章 搜索引擎及其技术架构 1
1.1 搜索引擎为何重要 1
1.1.1 互联网的发展 1
1.1.2 商业搜索引擎公司的发展 3

显示全部
用户评论
入门书都给人一种什么东西都是故弄玄虚其实秒懂的错觉
出乎意料的好
有点过时了,微信读书的排版很极品,但貌似目前也没有很好的搜索引擎中文科普了。
挺好的入门书
比较通俗,可惜对细节涉及不深,每章最后自带paper references
D1图书馆
扫盲书
读这本书让我感觉回到了大学时期学课本教材。本书用心的介绍了搜索引擎原理和核心技术,是本搜索引擎技术入门的好书。 但是总是要挑挑毛病对吧,一是这书写的比较早了技术已经不新了,二是作者在书里对不同内容的介绍的繁简程度把控我没太懂,大白话说就是我不太明白为什么有的地方特别详细有的地方一带而过。 总之是本入门好书,另外必须感叹,发明出这些搜索算法的人也太聪明了!
结构清晰,不懂技术也能轻松了解搜索引擎原理
概览书。
下载
收藏