按道理来说老是爬别的搜索引擎应该早被屏蔽啊?是用了代理池还是怎么滴?
自然是整合不同引擎的搜索结果。如果符合爬虫的规范,为什么会被屏蔽呢?
搜索引擎分为全文搜索引擎、目录索引、元搜索引擎,元搜索引擎就是通过一个统一的用户界面帮助用户在多个搜索引擎中选择和利用合适的(甚至是同时利用若干个)搜索引擎来实现检索操作,是对分布于网络的多种检索工具的全局控制机制。
一个真正的元搜索引擎由三部分组成,即:检索请求提交机制、检索接口代理机制、检索结果显示机制。"请求提交"负责实现用户"个性化"的检索设置要求,包括调用哪些搜索引擎、检索时间限制、结果数量限制等。"接口代理"负责将用户的检索请求"翻译"成满足不同搜索引擎"本地化"要求的格式。"结果显示"负责所有元搜索引擎检索结果的去重、合并、输出处理等。元搜索引擎的出现,对于那些需要连续地使用不同的搜索引擎重复相同的检索的人来说,是一个福音。使用元搜索引擎同时对几个搜索引擎进行检索,获得分级编排的检索。