CN105955990A - 一种兼顾多样性和有效性的评论排序和筛选方法 - Google Patents

一种兼顾多样性和有效性的评论排序和筛选方法 Download PDF

Info

Publication number
CN105955990A
CN105955990A CN201610245146.1A CN201610245146A CN105955990A CN 105955990 A CN105955990 A CN 105955990A CN 201610245146 A CN201610245146 A CN 201610245146A CN 105955990 A CN105955990 A CN 105955990A
Authority
CN
China
Prior art keywords
comment
sequence
comments
cluster
collection
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
CN201610245146.1A
Other languages
English (en)
Inventor
牛振东
陈杰
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Beijing Institute of Technology BIT
Original Assignee
Beijing Institute of Technology BIT
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Beijing Institute of Technology BIT filed Critical Beijing Institute of Technology BIT
Publication of CN105955990A publication Critical patent/CN105955990A/zh
Pending legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G06COMPUTING; CALCULATING OR COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F16/00Information retrieval; Database structures therefor; File system structures therefor
    • G06F16/90Details of database functions independent of the retrieved data types
    • G06F16/95Retrieval from the web
    • G06F16/951Indexing; Web crawling techniques
    • GPHYSICS
    • G06COMPUTING; CALCULATING OR COUNTING
    • G06FELECTRIC DIGITAL DATA PROCESSING
    • G06F40/00Handling natural language data
    • G06F40/20Natural language analysis
    • G06F40/205Parsing

Landscapes

  • Engineering & Computer Science (AREA)
  • Theoretical Computer Science (AREA)
  • Physics & Mathematics (AREA)
  • General Engineering & Computer Science (AREA)
  • General Physics & Mathematics (AREA)
  • Databases & Information Systems (AREA)
  • Data Mining & Analysis (AREA)
  • Health & Medical Sciences (AREA)
  • Artificial Intelligence (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Computational Linguistics (AREA)
  • General Health & Medical Sciences (AREA)
  • Information Retrieval, Db Structures And Fs Structures Therefor (AREA)

Abstract

本发明涉及一种兼顾多样性和有效性的评论排序和筛选方法,具体为:①从待排序评论集中提取评论目标的特征集。②依次对待排序评论集中的每一条评论进行处理,得到每条评论中涉及的特征数。③对待排序评论集根据特征进行聚类,使每条评论归属到一个特征类别中。④在每个聚类中,按照评论涉及的评论数由高到低的顺序,对该聚类中的评论进行排序。⑤设定选取数量为m,从每个聚类中选取前n为聚类数。然后,将选取出来的条评论,按照评论涉及的评论数由高到低的顺序重新排序并展示。本发明方法使评论列表排序效果更符合人类认知,能够优先输出对其他用户更有帮助的列表排序,而且兼顾评论内容的全面性。

Description

一种兼顾多样性和有效性的评论排序和筛选方法
技术领域
本发明涉及一种兼顾多样性和有效性的评论排序和筛选方法,属于计算机应用技术领域。
背景技术
评论数据(Review Data)是一种发布在互联网上,表达评论目标某些特征方面状况和自己对评价目标情感的数据。围绕同一个评论目标的评论文本构成了评论数据集,在展示评论数据集时多采用列表的方式。
传统的排序方法大多是基于评论文本的某一项属性进行排序,例如按照评论发表的时间先后顺序、按照评论的点赞数排序、按照评论人的用户级别等。这类方法的排序对象之间仅存在排序属性上的次序关系,而这些排序属性是符合用户思路或者产品需求的,对评论文本排序具有良好的效果。但是,评论文本是用户对评论目标基于自身认识而发表的个人意见性文本,评论中包含了对评论目标的使用感受、情感和特征描述等内容,对于其他用户具有参考价值,评论内容的有效性也是影响评论排序的关键因素。此外,不同用户发表的评论文本在描述评价对象时的侧重点不同,围绕评论目标进行全方位的评论文本展示具有很重要的作用。因此,传统基于单一排序属性的方法不适合对评论文本列表进行排序。
目前,在已有文献中,还未有兼顾多个特征的评论排序和筛选方法的相关记载。
发明内容
本发明的目的是提出一种兼顾多样性和有效性的评论排序和筛选方法。该方法能够筛选出比依赖单一排序属性方法更加符合人类需求的排序结果。
本发明的目的是通过下述技术方案实现的。
本发明的一种兼顾多样性和有效性的评论排序和筛选方法,其具体操作步骤为:
步骤一、从待排序评论集中提取评论目标的特征集。
步骤1.1:采用词性标注工具对评论进行标注。
步骤1.2:对待排序评论集中的名词出现次数进行统计,利用出现次数大于频次中位数的名词构成评价目标的特征集。
步骤二、依次对待排序评论集中的每一条评论进行处理,得到每条评论中涉及的特征数。
步骤三、对待排序评论集根据特征进行聚类,使每条评论归属到一个特征类别中。
步骤四、在每个聚类中,按照评论涉及的评论数由高到低的顺序,对该聚类中的评论进行排序。
步骤五、设定选取数量为m,从每个聚类中选取前条评论,其中,n为聚类数。然后,将选取出来的条评论,按照评论涉及的评论数由高到低的顺序重新排序并展示。
经过上述步骤的操作,即兼顾多样性和有效性,对待评论集评论中的评论进行排序和筛选。
有益效果
本发明提出的兼顾多样性和有效性的评论排序和筛选方法与已有技术相比较,本发明方法使评论列表排序效果更符合人类认知,能够优先输出对其他用户更有帮助的列表排序,节省用户寻找有用评论的时间,并且兼顾评论内容的全面性,便于用户全面了解目标以及其他用户对于该目标的观点。
具体实施方式
下面结合附图和具体实施例对本发明技术方案做进一步描述。
本实施例使用兼顾多样性和有效性的评论排序和筛选方法对一个企业评论集进行排序和筛选,其操作流程如图1所示,其具体操作步骤为:
步骤一、从待排序评论集中提取评论目标的特征集。待排序评论集是A公司员工对本公司的260条评论,获取特征集的方法为:
步骤1.1:采用词性标注工具对评论进行标注。
步骤1.2:对待排序评论集中的名词出现次数进行统计,利用出现次数大于频次中位数的名词构成评价目标的特征集。
经过该步骤的操作,得到的特征集为:{员工待遇、加班情况、伙食、出差补助、管理方式、开会次数、面试难度、工作压力、名气}。
步骤二、依次对待排序评论集中的每一条评论进行处理,将每一条评论与特征集中的特征进行对比,得到每条评论中涉及特征的数量。
步骤三、对待排序评论集根据特征进行聚类为n个类别,n=4,使每条评论归属到一个特征类别中。
步骤四、在每个聚类中,按照评论涉及的评论数由高到低的顺序,对该聚类中的评论进行排序。
步骤五、设定选取数量为m=20,从每个聚类中选取前5条评论。然后,将选取出来的20条评论,按照评论涉及的评论数由高到低的顺序重新排序并展示。
经过上述步骤的操作,即兼顾多样性和有效性,对待评论集评论中的评论进行排序和筛选。

Claims (1)

1.一种兼顾多样性和有效性的评论排序和筛选方法,其特征在于:其具体操作步骤为:
步骤一、从待排序评论集中提取评论目标的特征集;
步骤1.1:采用词性标注工具对评论进行标注;
步骤1.2:对待排序评论集中的名词出现次数进行统计,利用出现次数大于频次中位数的名词构成评价目标的特征集;
步骤二、依次对待排序评论集中的每一条评论进行处理,得到每条评论中涉及的特征数;
步骤三、对待排序评论集根据特征进行聚类,使每条评论归属到一个特征类别中;
步骤四、在每个聚类中,按照评论涉及的评论数由高到低的顺序,对该聚类中的评论进行排序;
步骤五、设定选取数量为m,从每个聚类中选取前条评论,其中,n为聚类数;然后,将选取出来的条评论,按照评论涉及的评论数由高到低的顺序重新排序并展示;
经过上述步骤的操作,即兼顾多样性和有效性,对待评论集评论中的评论进行排序和筛选。
CN201610245146.1A 2016-04-15 2016-04-19 一种兼顾多样性和有效性的评论排序和筛选方法 Pending CN105955990A (zh)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
CN2016102356946 2016-04-15
CN201610235694 2016-04-15

Publications (1)

Publication Number Publication Date
CN105955990A true CN105955990A (zh) 2016-09-21

Family

ID=56917693

Family Applications (1)

Application Number Title Priority Date Filing Date
CN201610245146.1A Pending CN105955990A (zh) 2016-04-15 2016-04-19 一种兼顾多样性和有效性的评论排序和筛选方法

Country Status (1)

Country Link
CN (1) CN105955990A (zh)

Cited By (4)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN106557948A (zh) * 2016-10-18 2017-04-05 李超 一种评论信息的展示方法及装置
CN108710632A (zh) * 2018-04-03 2018-10-26 北京奇艺世纪科技有限公司 一种语音播放方法及装置
CN110674415A (zh) * 2019-09-20 2020-01-10 北京浪潮数据技术有限公司 一种信息显示方法、装置及服务器
CN111866578A (zh) * 2019-12-31 2020-10-30 北京嘀嘀无限科技发展有限公司 数据处理方法和装置、电子设备及计算机可读存储介质

Citations (5)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN1758244A (zh) * 2004-04-30 2006-04-12 微软公司 用于排列搜索结果的文档以改进多样性和信息丰富度的方法和系统
CN103577988A (zh) * 2012-07-24 2014-02-12 阿里巴巴集团控股有限公司 一种识别特定用户的方法和装置
CN104156390A (zh) * 2014-07-07 2014-11-19 乐视网信息技术(北京)股份有限公司 一种评论推荐方法和系统
CN104239331A (zh) * 2013-06-19 2014-12-24 阿里巴巴集团控股有限公司 一种用于实现评论搜索引擎排序的方法和装置
CN104281665A (zh) * 2014-09-25 2015-01-14 北京百度网讯科技有限公司 一种用于确定评论的有效性的方法与装置

Patent Citations (5)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN1758244A (zh) * 2004-04-30 2006-04-12 微软公司 用于排列搜索结果的文档以改进多样性和信息丰富度的方法和系统
CN103577988A (zh) * 2012-07-24 2014-02-12 阿里巴巴集团控股有限公司 一种识别特定用户的方法和装置
CN104239331A (zh) * 2013-06-19 2014-12-24 阿里巴巴集团控股有限公司 一种用于实现评论搜索引擎排序的方法和装置
CN104156390A (zh) * 2014-07-07 2014-11-19 乐视网信息技术(北京)股份有限公司 一种评论推荐方法和系统
CN104281665A (zh) * 2014-09-25 2015-01-14 北京百度网讯科技有限公司 一种用于确定评论的有效性的方法与装置

Non-Patent Citations (1)

* Cited by examiner, † Cited by third party
Title
余文喆: "基于内容分析的评论组织方法研究", 《中国优秀硕士学位论文全文数据库》 *

Cited By (5)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN106557948A (zh) * 2016-10-18 2017-04-05 李超 一种评论信息的展示方法及装置
CN108710632A (zh) * 2018-04-03 2018-10-26 北京奇艺世纪科技有限公司 一种语音播放方法及装置
CN110674415A (zh) * 2019-09-20 2020-01-10 北京浪潮数据技术有限公司 一种信息显示方法、装置及服务器
CN110674415B (zh) * 2019-09-20 2022-06-17 北京浪潮数据技术有限公司 一种信息显示方法、装置及服务器
CN111866578A (zh) * 2019-12-31 2020-10-30 北京嘀嘀无限科技发展有限公司 数据处理方法和装置、电子设备及计算机可读存储介质

Similar Documents

Publication Publication Date Title
Marchetti-Bowick et al. Learning for microblogs with distant supervision: political forecasting with Twitter
Larsen et al. The rate of growth in scientific publication and the decline in coverage provided by Science Citation Index
Kontopoulos et al. Ontology-based sentiment analysis of twitter posts
Mitrović et al. Networks and emotion-driven user communities at popular blogs
CN103294778B (zh) 一种推送资讯信息的方法及系统
CN105955990A (zh) 一种兼顾多样性和有效性的评论排序和筛选方法
CN104077407B (zh) 一种智能数据搜索系统及方法
CN102682120B (zh) 一种网络评论精华文本的获取方法和装置
CN104298665A (zh) 一种中文文本中评价对象的识别方法及装置
Chatzakou et al. Harvesting opinions and emotions from social media textual resources
US9218426B1 (en) Apparatus and method for personalized delivery of content from multiple data sources
CN106569996B (zh) 一种面向中文微博的情感倾向分析方法
CN103186560B (zh) 一种数据排序方法以及相关装置
CN106055539A (zh) 姓名消歧的方法和装置
Anwar et al. Identifying cliques in dark web forums-an agglomerative clustering approach
Wainer et al. Scientific production in computer science: A comparative study of Brazil and other countries
JP2017107391A (ja) テキストマイニング方法、及びテキストマイニングプログラム
CN108073567A (zh) 一种特征词提取处理方法、系统及服务器
EP2221735A2 (de) Verfahren zum automatischen Klassifizieren eines Textes durch ein Computersystem
CN106708920A (zh) 一种针对个性化科研文献的筛选方法
CN101471890B (zh) 一种实现网络信息匹配的方法和系统
JP6494977B2 (ja) サポート装置、サポート方法及びサポートプログラム
Tam et al. Automatic foldering of email messages: a combination approach
WO2016063403A1 (ja) データ分析システム、データ分析方法、およびデータ分析プログラム
Byerly et al. women, journalism, and labor unions

Legal Events

Date Code Title Description
C06 Publication
PB01 Publication
C10 Entry into substantive examination
SE01 Entry into force of request for substantive examination
RJ01 Rejection of invention patent application after publication

Application publication date: 20160921

RJ01 Rejection of invention patent application after publication