免费阅读
返回
菜单
上一章查看最新章节下一章

第四十六章 搜索引擎的研发

作品:传奇1997作者:狂花非叶
如果本章错误,请点击报错10秒纠正

目前搜索引擎项目最大的困难在于,没有可供参考的对象。

虽然可以参考一些国外的资料和论文,但因为涉及到一些核心技术,是无法通过网络查找到的,都需要自行开发。

隋波点头表示同意。

这个时候Google还不存在呢,要到9月份的时候,布林和佩奇才会在加州一个车库里开始创业。

百度更是没影的事儿,老李还在搜信里混呢。

现阶段,无论是国外的Lycos、AltaVista、Infoseek(搜信),雅虎搜索引擎;还是国内搜狐推出的所谓全中文搜索引擎,都还是以人工分类目录为主的网站检索服务。

说是搜索引擎,其实更像是目录导航网站……

尽管其中一些搜索引擎已经有了网页关键词检索、用户点击量排序等一些创新,但本质上,还是需要大量的人工编辑的目录式搜索引擎(Directory Search Engine)。

而隋波希望王川团队开发的,则是全新的,通过技术程序,自动在互联网上通过超链接网页进行全文检索的机器人搜索引擎(Robot Search Engine)。

这样的话,就需要从头做起,开发一整套完整的技术体系。

其中包括网络爬虫(Web Crawler)服务、索引服务、缓存服务、日志服务等几大模块,各模块之间互相影响,构成了整个搜索引擎体系。

从开发量上,技术难度是远远大于目录式检索技术的。

首先说网络爬虫,也称网络蜘蛛(Web Spider),这项技术是基于Web的自动化浏览程序,通过网页链接(URL),爬虫不断的通过互联网中获得新的网页数据,下载页面数据形成后台数据库。

可以说,网络爬虫抓取数据是搜索引擎工作流程的第一步。

爬虫的体系架构直接关系到搜索引擎每天数据的采集量,而抓取策略则关系到搜索结果的数据质量,数据的更新策略则关系到系统资源的利用率。

这只是第一步,采集了大量数据信息之后,还需要通过自然语言处理(NLP),将文本信息分解为结构化数据和价值性数据。

这里面就又存在一个问题,目前国外的搜索引擎都是英文分词,而中文比较特殊,最小单位是字,但具有语义的最小单位是词。

所以,在中文分词这一部分,就需要技术团队单独进行开发。

…。。
   本章没完,请点击下—页继续阅读!如果被转码了请退出转码或者更换浏揽器即可。
  温馨提示:亲爱的读者,如果你觉得本站还好,为了避免丢失和转马,请勿依赖搜索访问,建议你使用[华为刘揽器]或[Firefox火狐刘揽器]访问并收蔵【风暴书院】 m.ffbbx.com。我们将会持续为你更新,还建议你注册会员使用书架功能追书阅读更方便。
上一页 1234下一页
上一章查看目录下一章
临时书架加入书签回顶部↑

看了《传奇1997》的书友还喜欢看

农家闲散人
作者:修仙呢没空
简介: 沈暖夏卷完前世卷今生,现世她只想做闲鱼。种种田,摸摸鱼,不知不觉修个在世仙。
更新时间:2026-03-03 23:28:07
最新章节:第一百零九章 祝愿
公路求生:美女别追了,求放过!
作者:九尾紫衣
简介: 【跑毒】【硬核求生】【组建车队】【种田建造】【无系统】【设定严谨】\n
更新时间:2026-03-03 23:40:25
最新章节:第414章 区域频道里面的骂战
摆烂继父,养女越强我越躺!
作者:尝衫道士
简介: 【修仙+家庭+养女+返还+迪化】

林墨穿成修行家族赘婿,白...
更新时间:2026-03-03 23:09:00
最新章节:第五百一十八章:究竟,谁才是魔鬼?
七零娇小姐随军,惊艳家属院
作者:商格格
简介: 【年代+穿书+空间+掏空家产+先婚后爱】明熙意外穿越了,成了年代文里肤白貌美,明艳动...
更新时间:2026-03-03 23:28:00
最新章节:第244章 一夜爆火
重生八零,苏小姐杀疯了
作者:倾城五儿
简介: 苏瑶死前才知道,自己一辈子未婚。她被江家骗了一辈子,为江家奉献了自己的一辈子。
更新时间:2026-03-03 23:27:00
最新章节:第175章 离了
被休后,每日情报助我熬过荒年
作者:慕莲莲
简介: 灾荒+系统+日常流+发家致富+极品不多+无空间\n李木槿在末世挣扎求生了一年,死于饥...
更新时间:2026-03-03 23:35:18
最新章节:第371章 他是谁?
书名:

本站若有图片广告属于第三方接入,非本站所为,广告内容与本站无关,不代表本站立场,请谨慎阅读。

Copyright © 2020 风暴书院 All Rights Reserved.kk

SiteMap