• Complex
  • Title
  • Keyword
  • Abstract
  • Scholars
  • Journal
  • ISSN
  • Conference
搜索

Author:

陈欣 (陈欣.) | 张菁 (张菁.) (Scholars:张菁) | 李晓光 (李晓光.) | 卓力 (卓力.)

Indexed by:

CQVIP PKU CSCD

Abstract:

提出了一种面向中文敏感网页识别的文本分类方法,主要包括中文分词、停用词表的建立、特征选择、分类器等4个部分.为丰富中文分词词库,提出了一种以词频统计为主、以人工判决为辅并标注词性的新词识别算法;提出了一种停用词表的建立算法,据此建立了含300个停用词的停用词表;采用开方拟合检验统计量方法作为特征选择方法,并确定了400维的特征词库.根据开方拟合统计量特征选择方法与朴素贝叶斯分类器的特点,加入待分类网页文本中所含特征项数目与特征集维数的比值以及特征项数目与文本所含词汇数目的比值两个影响因子,对朴素贝叶斯分类器进行了改进.考虑到不同的人群对敏感概念的主观理解差异较大,将待识别网页的敏感度值作为分类器的输出.实验结果表明,与现有的文本分类方法相比,所提出的文本分类方法可以获得更好的识别效果.

Keyword:

停用词表建立 新词识别 CHI统计 朴素贝叶斯分类器 中文敏感网页识别

Author Community:

  • [ 1 ] [陈欣]北京工业大学
  • [ 2 ] [张菁]北京工业大学
  • [ 3 ] [李晓光]北京工业大学
  • [ 4 ] [卓力]北京工业大学

Reprint Author's Address:

Email:

Show more details

Related Keywords:

Source :

测控技术

ISSN: 1000-8829

Year: 2011

Issue: 5

Volume: 30

Page: 27-31,40

Cited Count:

WoS CC Cited Count: 0

SCOPUS Cited Count:

ESI Highly Cited Papers on the List: 0 Unfold All

WanFang Cited Count: 4

Chinese Cited Count:

30 Days PV: 14

Online/Total:531/10583550
Address:BJUT Library(100 Pingleyuan,Chaoyang District,Beijing 100124, China Post Code:100124) Contact Us:010-67392185
Copyright:BJUT Library Technical Support:Beijing Aegean Software Co., Ltd.