Logo 知识与财富的链接
基于混合跳链条件随机场的异构Web记录集成方法

基于混合跳链条件随机场的异构Web记录集成方法

ISSN:1000-9825
2008年第19卷第8期
计算机网络与信息安全
HUANG Jian-Bin,姬红兵,SUN He-Li HUANG Jian-Bin,JI Hong-Bing,SUN He-Li
西安电子科技大学,电子工程学院,陕西,西安,710071

提出了一种混合跳链条件随机场序列统计学习模型,以实现异构Web记录与关系数据库的模式匹配.该模型可以在由手工标注样本和关系数据库记录组成的联合样本集上进行训练,减少了对繁琐手工标注样本的依赖.此外,通过在线性链条件随机场模型上增加对跳边的支持,使得该模型能够有效地处理状态变量间的长距离依赖.在多个领域的真实数据集上的实验结果表明,所提出的方法能够显著提高异构Web记录语义模式匹配的性能.

An improved sequence labeling model named Mixed Skip-Chain Conditional Random Field is presented to solve the problem of schema matching between semi-structured Web records and relational database. The proposed model can be trained on mixed samples set which consists of labeled samples and unlabeled relational database records to reduce the dependence on manually labeled training data.Moreover,it provides a novel way to incorporate the long-distance dependencies between different state variants.Experimental results using a large number of real-world data collected from diverse domains show that the proposed method can improve the performance of schema matching significantly.

认领
收 藏
点 赞
认领进度
0 %

发表评论

ISSN:1000-9825
2008年第19卷第8期
计算机网络与信息安全

用户信息设置