b2科目四模拟试题多少题驾考考爆了怎么补救
b2科目四模拟试题多少题 驾考考爆了怎么补救

搜索引擎系统的原理与实践(2)

电脑杂谈  发布时间:2020-06-03 06:19:01  来源:网络整理

CJKAnalyzer分析器的分词工具是CJKTokenizer的核心类. 对于条目的过滤操作,通过stopTable类在程序中指定CJKAnalyze.

(3)文档分析和过滤

建立索引非常重要. 例如,我们需要在d: \\ test \ index目录中搜索文件. 首先要做的是建立索引.

在Lucene中,它可以大致分为以下操作:

(1)创建一个目录来存储索引

web services原理与研发实践 pdf_soa原理方法实践 pdf_搜索引擎原理与实践 pdf

(2)创建索引器配置管理类IndexWriterConfig

(3)在Lucene中创建索引器,例如索引目录

(4)使用先前创建的索引器使用Lucene的数据结构文档将其写入文件.

(1)Lucene全文搜索实现机制

Lucene的API设计非常实用,可以理解为大型. 通过存储结构/接口结构,它可以轻松执行查询等操作.

索引表是由IndexWriter创建的,可以理解为中的表. Lucene通过分析器指定了构建方法. Lucene提供了可在多种环境中使用的分析器: SimpleAnalyzer,StandardAnalyzer,GermanAnalyzer等. StandardAnalyzer之所以经常使用是因为它提供了对中文的支持.

(2)基于Lucene索引的查询

Lucene包含大量面向对象的思想. 作为Apache的通用工具包,Lucene为需要向系统添加全文搜索功能的软件开发人员提供了很多便利.

以下是在学习过程中Lucene基于索引的复合查询的代码片段:

//新建查询实例
Query query=MultiFieldQueryParser.parse("索引",new String[]{"title","content"},analyzer);
        Query mquery=new WildcardQuery(new Term("sender","bluedavy*"));
        TermQuery tquery=new TermQuery(new Term("name","jerry"));
        
        BooleanQuery bquery=new BooleanQuery();
        bquery.add(query,true,false);
        bquery.add(mquery,true,false);
        bquery.add(tquery,true,false);
//索引查询实例
        Searcher searcher=new IndexSearcher(indexFilePath);
        Hits hits=searcher.search(bquery);
        for (int i = 0; i < hits.length(); i++) {
         System.out.println(hits.doc(i).get("name"));
    }

(1)Nutch

Apache Nutch是一个高度可扩展和可扩展的开源Web爬网程序软件项目,它起源于Apache Lucene. 该项目是多元化的,现在包括两个协议的代码库:

Nutch 1.x: 是成熟的,可立即投入生产的爬虫. 1.x取决于Apache Hadoop.

Nutch 2.x: 一种直接受1.x启发的新兴替代方法,但有一个不同的关键: 使用Apache Gora处理对象持久性映射搜索引擎原理与实践 pdf,将抽象存储与任何特定的基本数据存储区分开. 这意味着我们可以为多个NoSQL存储解决方案存储所有极其灵活的模型/堆栈实现(提取时间,状态,内容,已解析的文本,类型,反向链接等).

Nutch提供了运行搜索引擎所需的所有工具,包括网络爬虫和全文本搜索.

Nutch基于Lucene. Lucene为Nutch提供了文本索引和搜索API.

在选择Nutch和Lucene时,判断标准主要是是否需要获取数据,如果不需要,则应使用Lucene.

(2)Lucene

Lucene是Apache软件基金会的开源索引工具包,

这是一个基于Java的文本搜索引擎索引工具包,它提供了全文搜索引擎的总体架构,

还有一个完整的查询和索引引擎,其中包含一些文本处理工具.

Lucene的发展迅速,并致力于为搜索开发人员提供一种方便易用的组件,

使全文搜索功能更加方便. 同样,您也可以为骨骼构建一个完整的全文本搜索引擎.

(3)Lucene全文搜索实现机制

Lucene的API设计非常实用,可以理解为大型. 通过存储结构/接口结构,它可以轻松执行查询等操作.

索引表是由IndexWriter创建的,可以理解为中的表. Lucene通过分析器指定了构建方法. Lucene提供了可在多种环境中使用的分析器: SimpleAnalyzer,StandardAnalyzer,GermanAnalyzer等. StandardAnalyzer之所以经常使用是因为它提供了对中文的支持.


本文来自电脑杂谈,转载请注明本文网址:
http://www.pc-fly.com/a/jisuanjixue/article-232076-2.html

相关阅读
    发表评论  请自觉遵守互联网相关的政策法规,严禁发布、暴力、反动的言论

    热点图片
    拼命载入中...