我正在编写一个内部应用程序,其中包含多条文本信息以及有关这些文本的大量数据。这些数据将按照输入顺序保存在数据库(SQL Server,尽管这可能会改变)中。
我希望能够搜索这些信息中最相关的信息,并将最相关的信息放在顶部。我最初考虑使用 SQL Server 全文搜索,但它对于我的其他需求并不像我希望的那样灵活,所以看来我需要为此开发自己的解决方案。
据我了解,需要的是倒排索引 http://www.itl.nist.gov/div897/sqg/dads/HTML/invertedIndex.html,然后根据所保存的附加信息的结果恢复和修改所述倒排索引的内容(尽管现在这可以留到以后,因为我只想倒排索引从数据库中索引主要文本提供的表/字符串)。
我曾尝试使用哈希表在 Java 中编写此代码,其中键作为单词,值作为单词出现的列表,但老实说,我对 C# 仍然相当陌生,并且只真正使用过处理信息时,例如数据集和数据表。如果需要,我会在清除这台笔记本电脑上的病毒后立即上传 Java 代码。
如果给定表或字符串列表中的一组条目,如何在 C# 中创建倒排索引,最好将其保存到 DataSet/DataTable 中?
EDIT:我忘了提及,我已经尝试过 Lucene 和 Nutch,但需要我自己的解决方案,因为修改 Lucene 来满足我的需求比编写倒排索引花费的时间要长得多。我将处理大量元数据,一旦基本倒排索引完成,这些元数据也需要处理,因此我现在需要的只是使用倒排索引在一个区域上进行基本全文搜索。最后,处理倒排索引并不是我每天都要做的事情,所以尝试一下它会很棒。
以下是我过去在 C# 中成功使用的方法的粗略概述:
struct WordInfo
{
public int position;
public int fieldID;
}
Dictionary<string,List<WordInfo>> invertedIndex=new Dictionary<string,List<WordInfo>>();
public void BuildIndex()
{
foreach (int fieldID in GetDatabaseFieldIDS())
{
string textField=GetDatabaseTextFieldForID(fieldID);
string word;
int position=0;
while(GetNextWord(textField,out word,ref position)==true)
{
WordInfo wi=new WordInfo();
if (invertedIndex.TryGetValue(word,out wi)==false)
{
invertedIndex.Add(word,new List<WordInfo>());
}
wi.Position=position;
wi.fieldID=fieldID;
invertedIndex[word].Add(wi);
}
}
}
Notes:
GetNextWord() 迭代该字段并返回下一个单词和位置。要实现它,请使用 string.IndexOf() 和 char 字符类型检查方法(IsAlpha 等)。
GetDatabaseTextFieldForID() 和 GetDatabaseFieldIDS() 是不言自明的,根据需要实现。
本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系:hwhale#tublm.com(使用前将#替换为@)