CN118692450A - 问答处理方法、装置、设备、存储介质及程序产品 - Google Patents

问答处理方法、装置、设备、存储介质及程序产品 Download PDF

Info

Publication number
CN118692450A
CN118692450A CN202410797475.1A CN202410797475A CN118692450A CN 118692450 A CN118692450 A CN 118692450A CN 202410797475 A CN202410797475 A CN 202410797475A CN 118692450 A CN118692450 A CN 118692450A
Authority
CN
China
Prior art keywords
answer
target user
information
question
interaction state
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
CN202410797475.1A
Other languages
English (en)
Inventor
何思军
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Beijing Baidu Netcom Science and Technology Co Ltd
Original Assignee
Beijing Baidu Netcom Science and Technology Co Ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Beijing Baidu Netcom Science and Technology Co Ltd filed Critical Beijing Baidu Netcom Science and Technology Co Ltd
Priority to CN202410797475.1A priority Critical patent/CN118692450A/zh
Publication of CN118692450A publication Critical patent/CN118692450A/zh
Pending legal-status Critical Current

Links

Classifications

    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L15/00Speech recognition
    • G10L15/08Speech classification or search
    • G10L15/18Speech classification or search using natural language modelling
    • G10L15/1822Parsing for meaning understanding
    • GPHYSICS
    • G10MUSICAL INSTRUMENTS; ACOUSTICS
    • G10LSPEECH ANALYSIS TECHNIQUES OR SPEECH SYNTHESIS; SPEECH RECOGNITION; SPEECH OR VOICE PROCESSING TECHNIQUES; SPEECH OR AUDIO CODING OR DECODING
    • G10L25/00Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00
    • G10L25/48Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use
    • G10L25/51Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use for comparison or discrimination
    • G10L25/63Speech or voice analysis techniques not restricted to a single one of groups G10L15/00 - G10L21/00 specially adapted for particular use for comparison or discrimination for estimating an emotional state

Landscapes

  • Engineering & Computer Science (AREA)
  • Health & Medical Sciences (AREA)
  • Human Computer Interaction (AREA)
  • Computational Linguistics (AREA)
  • Audiology, Speech & Language Pathology (AREA)
  • Physics & Mathematics (AREA)
  • Acoustics & Sound (AREA)
  • Multimedia (AREA)
  • Hospice & Palliative Care (AREA)
  • Psychiatry (AREA)
  • General Health & Medical Sciences (AREA)
  • Signal Processing (AREA)
  • Child & Adolescent Psychology (AREA)
  • Artificial Intelligence (AREA)
  • Information Retrieval, Db Structures And Fs Structures Therefor (AREA)

Abstract

本公开提供了问答处理方法、装置、电子设备、计算机可读存储介质及计算机程序产品,涉及语音识别、自然语言处理和智能问答等人工智能技术领域。该方法的一具体实施方式包括:基于目标用户通过语音形式提供的问题信息,确定问题信息的答案语义;至少基于针对问题信息的语气识别结果,确定目标用户当前所处的交互状态;响应于交互状态为第一交互状态,利用预设的知识库将答案语义改写为标准长度的标准答案信息;向目标用户播放标准答案信息。由此,在针对用户的问题寻找答案、提供答案的过程中,能够基于用户的交互状态,对答案的内容形式进行调整,以帮助用户更为容易地接受、理解答案,提升与用户的交互、答复质量,增强用户的交互体验。

Description

问答处理方法、装置、设备、存储介质及程序产品
技术领域
本公开涉及计算机技术领域,具体涉及语音识别、自然语言处理和智能问答等人工智能技术领域,尤其涉及问答处理方法、装置、电子设备、计算机可读存储介质及计算机程序产品。
背景技术
随着计算机技术的发展,为了方便用户获取知识、解答疑惑,智能问答技术(Intelligent Question Answering,简称QA)应运而生。智能问答技术是一种人工智能技术,旨在使计算机系统能够理解人类提出的自然语言问题,并以精确、准确的方式提供答案。
相应地,为了使得用户能够更为便利地使用这项技术,越来越多的服务商会选择在例如智能音箱、智能手机的终端设备中部署相关应用,以使得用户可以通过语音形式来与这些终端设备交互,来更为便捷地使用智能问答服务。由此,在此过程中,如何更有质量地为用户提供服务,提升用户的交互体验,是值得关注和迫切需求的。
发明内容
本公开实施例提出了一种问答处理方法、装置、电子设备、计算机可读存储介质及计算机程序产品。
第一方面,本公开实施例提出了一种问答处理方法,包括:基于目标用户通过语音形式提供的问题信息,确定问题信息的答案语义;至少基于针对问题信息的语气识别结果,确定目标用户当前所处的交互状态;响应于交互状态为第一交互状态,利用预设的知识库将答案语义改写为标准长度的标准答案信息;向目标用户播放标准答案信息。
第二方面,本公开实施例提出了一种问答处理装置,包括:答案语义确定单元,被配置成基于目标用户通过语音形式提供的问题信息,确定问题信息的答案语义;交互状态确定单元,被配置成至少基于针对问题信息的语气识别结果,确定目标用户当前所处的交互状态;第一答案改写单元,被配置成响应于交互状态为第一交互状态,利用预设的知识库将答案语义改写为标准长度的标准答案信息;第一答案发送单元,被配置成向目标用户播放标准答案信息。
第三方面,本公开实施例提供了一种电子设备,该电子设备包括:至少一个处理器;以及与至少一个处理器通信连接的存储器;其中,存储器存储有可被至少一个处理器执行的指令,该指令被至少一个处理器执行,以使至少一个处理器执行时能够实现如第一方面中任一实现方式描述的问答处理方法。
第四方面,本公开实施例提供了一种存储有计算机指令的非瞬时计算机可读存储介质,该计算机指令用于使计算机执行时能够实现如第一方面中任一实现方式描述的问答处理方法。
第五方面,本公开实施例提供了一种包括计算机程序的计算机程序产品,该计算机程序在被处理器执行时能够实现如第一方面中任一实现方式描述的问答处理方法。
本公开实施例提供的问答处理方法、装置、电子设备、计算机可读存储介质及计算机程序产品,首先,基于目标用户通过语音形式提供的问题信息,确定问题信息的答案语义。然后,至少基于针对问题信息的语气识别结果,确定目标用户当前所处的交互状态。接下来,如果交互状态为第一交互状态,则利用预设的知识库将答案语义改写为标准长度的标准答案信息。最后,向目标用户播放标准答案信息。
本公开在针对用户的问题寻找答案、提供答案的过程中,能够基于用户的交互状态,对答案的内容形式进行调整,以帮助用户更为容易地接受、理解答案,提升与用户的交互、答复质量,增强用户的交互体验。
应当理解,本部分所描述的内容并非旨在标识本公开的实施例的关键或重要特征,也不用于限制本公开的范围。本公开的其它特征将通过以下的说明书而变得容易理解。
附图说明
通过阅读参照以下附图所作的对非限制性实施例所作的详细描述,本公开的其它特征、目的和优点将会变得更明显:
图1是本公开可以应用于其中的示例性系统架构;
图2为本公开实施例提供的一种问答处理过程的流程图;
图3为本公开实施例提供的一种确定答案语义的过程的流程图;
图4为本公开实施例提供的在一应用场景下的问答处理方法的流程示意图;
图5为本公开实施例提供的一种问答处理装置的结构框图;
图6为本公开实施例提供的一种适用于执行问答处理方法的电子设备的结构示意图。
具体实施方式
以下结合附图对本公开的示范性实施例做出说明,其中包括本公开实施例的各种细节以助于理解,应当将它们认为仅仅是示范性的。因此,本领域普通技术人员应当认识到,可以对这里描述的实施例做出各种改变和修改,而不会背离本公开的范围和精神。同样,为了清楚和简明,以下的描述中省略了对公知功能和结构的描述。需要说明的是,在不冲突的情况下,本公开中的实施例及实施例中的特征可以相互组合。
此外,本公开涉及的技术方案中,所涉及的用户个人信息(例如本公开后续涉及的包含人脸对象的图像)的获取、存储、使用、加工、运输、提供和公开等处理,均符合相关法律法规的规定,且不违背公序良俗。
图1示出了可以应用本公开的问答处理方法、装置、电子设备及计算机可读存储介质的实施例的示例性系统架构100。
如图1所示,系统架构100可以包括终端设备101、102、103,网络104和服务器105。网络104用以在终端设备101、102、103和服务器105之间提供通信链路的介质。网络104可以包括各种连接类型,例如有线、无线通信链路或者光纤电缆等等。
用户106可以使用终端设备101、102、103通过网络104与服务器105交互,以接收或发送消息等。终端设备101、102、103和服务器105上可以安装有各种用于实现两者之间进行信息通讯的应用,例如问答类应用、语义交互类应用、即时通讯类应用等。
终端设备101、102、103和服务器105可以是硬件,也可以是软件。当终端设备101、102、103为硬件时,可以是具有显示屏的各种电子设备,包括但不限于智能手机、平板电脑、智能音箱、膝上型便携计算机和台式计算机等等;当终端设备101、102、103为软件时,可以安装在上述所列举的电子设备中,其可以实现成多个软件或软件模块,也可以实现成单个软件或软件模块,在此不做具体限定。当服务器105为硬件时,可以实现成多个服务器组成的分布式服务器集群,也可以实现成单个服务器;服务器为软件时,可以实现成多个软件或软件模块,也可以实现成单个软件或软件模块,在此不做具体限定。
服务器105通过内置的各种应用可以提供各种服务,以可以提供问答服务的问答类应用为例,服务器105在运行该问答类应用时可实现如下效果:首先,用户106可以通过语音的形式,与终端设备101、102、103进行交互,来提供问题信息。然后,服务器105可以通过网络104从终端设备101、102、103获取这些问题信息,基于目标用户通过语音形式提供的问题信息,确定问题信息的答案语义;然后,服务器105至少基于针对问题信息的语气识别结果,确定目标用户当前所处的交互状态;接下来,服务器105响应于交互状态为第一交互状态,利用预设的知识库将答案语义改写为标准长度的标准答案信息;最后,服务器105可以利用终端设备101、102、103来向目标用户播放标准答案信息。
由于寻找问题信息对应的答案语义、改写答案语义可能需要占用较多的运算资源和较强的运算能力,因此本公开后续各实施例所提供的问答处理方法一般由拥有较强运算能力、较多运算资源的服务器105来执行,相应地,问答处理装置一般也设置于服务器105中。但同时也需要指出的是,在终端设备101、102、103也具有满足要求的运算能力和运算资源时,在此情况下,出于例如方便用户使用的目的,终端设备101、102、103也可以通过其上安装的问答类应用完成上述本交由服务器105做的各项运算,进而输出与服务器105同样的结果。尤其是在同时存在多种具有不同运算能力的终端设备的情况下,但问答类应用判断所在的终端设备拥有较强的运算能力和剩余较多的运算资源时,可以让终端设备来执行上述运算,从而适当减轻服务器105的运算压力,相应地,问答处理装置也可以设置于终端设备101、102、103中。在此种情况下,示例性系统架构100也可以不包括服务器105和网络104。
应该理解,图1中的终端设备、网络和服务器的数目仅仅是示意性的。根据实现需要,可以具有任意数目的终端设备、网络和服务器。
请参考图2,图2为本公开实施例提供的一种问答处理过程的流程图,其中流程200包括以下步骤:
步骤201:基于目标用户通过语音形式提供的问题信息,确定问题信息的答案语义;
本步骤旨在由问答处理方法的执行主体(例如图1所示的服务器105)获取目标用户(例如,上述用户106)通过语音形式提供的问题信息后,确定出对应于该问题信息的答案语义。例如,执行主体可以在获取、确定问题信息后,利用在线数据库,预先训练的答案匹配模型等方式,来生成问题信息对应的答案。例如,执行主体可以通过汇聚、结合多个平台和数据库中的内容后,生成“参考答案”。然后基于对这样的“参考答案”的语义分析,来提取出对应于问题信息的“答案语义”。
在一些实施例中,答案语义通常可以被理解为,是能够表达“答案”所实际包含内容的“最简”形式。而这样的“最简”形式,至少可以被执行主体所阅读,以用于转化成可以被“用户”所阅读、理解的文本内容(例如,通过基于预先设置的映射关系,对答案语义进行映射,得到可以被用户所阅读的文本形式的答案,或者,通过加入用于辅助理解的字、词、句,来将答案语义调整为能够被用户所阅读的文本形式的答案)。当然在一些场景中,也存在例如因最终的答案的内容过短等原因,使得答案语义也能够被用户所直接阅读,本公开不旨在对此进行限制。
示例性地,用户可能询问明天的天气,执行主体基于数据库A中获取其提供的第一答案“明天的天气为晴天”,基于平台B中获取到由其提供的第二答案“明天的天气中风向为东南,风力为3级”等等。然后,执行主体基于这些“答案”进行汇总,得到语义“晴、东南3级风”。
需要指出的是,用于生成答案语义的“至少部分答案”可以由上述执行主体直接从本地的存储设备获取,也可以从非本地的存储设备(例如图1所示的终端设备101、102、103)中获取。本地的存储设备可以是设置在上述执行主体内的一个数据存储模块,例如服务器硬盘,在此种情况下,“至少部分答案”可以在本地快速读取到;非本地的存储设备还可以为其它任何被设置用于存储数据的电子设备,例如一些用户终端等,在此情况下,上述执行主体可以通过向该电子设备发送获取命令来获取所需的“至少部分答案”。
步骤202:至少基于针对问题信息的语气识别结果,确定目标用户当前所处的交互状态;
在步骤201的基础上,本步骤旨在由上述执行主体至少基于针对问题信息的语气识别结果,确定目标用户当前所处的交互状态。例如,执行主体可以通过解析问题信息对应的语音段(或者说,音频段),来确定用户所处于的交互状态。例如,执行主体可以基于对语音段的语速、音量、语气等方面的解析结果,确定用户当前所处的交互状态。
示例性地,在仅从语速、音量、语气中的一个维度进行参考的场景中,执行主体可以选择根据所对应指标,来设置多个数值区段,以用于对应交互状态。例如,执行主体在确定语速处于第一个数值区段时,确定用户处于第一交互状态。执行主体在确定语速处于第二个数值区段时,确定用户处于第而交互状态,该第二数值区段所对应的数值高于第一个数值区段,即,落入第二数值区段的“语速”解析结果相较于落入第一数值区段的“语速”解析结果具有更高、更快的语速。
相应地,预先可以基于对大量相关用户的数据分析,来确定语速与状态之间的对应关系。例如,本公开所提供的问答处理方法,可以被理解为是一种“个性化的服务”(例如,其可以被理解是根据用户的语气、情绪来对答案的内容形式、提供答案的交互形式进行调整的服务),在这样的场景下,这样的“相关用户”则可以被理解是期望使用这样的服务的个性化用户、特殊需求用户。相应地,在期望为这些个性化用户、特殊需求用户提供服务时,可以将期望使用这样的功能来实现语音交互的个性化用户和/或将期望、存在为这样的功能提供参考的“其他用户”作为参考用户(或者说,被参考的用户),然后,通过对大量参考用户的群体分析,来确定语速这一个指标与交互状态的对应关系。类似地,后续执行主体则可以通过用户的设置,或者通过对用户的分析来确定用户是否属于该“个性化用户、特殊用户”,进而来提供这样的“个性化服务”。
示例性地,交互状态可以通过例如情绪状态的方式来被划分,或者说分类。例如,对应第一交互状态,其可能、可以对应于被参考的用户群体例如情绪平稳的普通情绪状态,而第二交互状态其可能、可以对应于被参考的用户群体例如“急躁”、“烦躁”、“不耐烦”、“生气”等情绪状态,第三交互状态可能对应于被参考的用户群体例如“疑惑”、“谨慎”、“少言”、“忧郁”或“沮丧”等情绪状态。由此,以便于后续执行主体可以基于交互状态的划分结果,来适应行地调整对用户的答复策略。
语音情绪识别(Speech Emotion Recognition,简称SER)可以通过一段语音的声学特征(该特征与语音的内容信息和语种信息无关)来识别用户(或者说,说话人)的交互状态,或者说,情绪状态。用户可以通过调整发音器官的动作来改变语音信号的声学特征来表达不同的情绪。相应地,通常可以通过离散形式情绪描述模型和连续形式情绪描述模型来对用户所录入的语音内容进行处理,以对应的识别其“交互状态”。
在一些实施例中,如果基于语速、音量、语气中的两项或者两项以上来联合地确定交互状态,执行主体则可以通过对应各个指标生成评分。然后,基于评分的加和,或者加权加和结果,来确定交互状态。例如,加和评分结果由低至高可以分别对应于用户从谨慎、疑惑、忧郁等状态逐渐变为情绪平稳,以及进一步变成“急躁”等场景。
示例性地,在该过程中随着语速的增加(导致语速对应的评分增加),音量的增大(导致音量对应的评分增加),语气中例如重读字符占比的增加(导致音量对应的评分增加),用户可能被确定具有更高的评分加和结果。例如,对于基于更慢的语速、更小的音量和重读字符占比较小的第一问题信息,具有更快的语速、更大的音量和更高的重读字符占比的第二问题信息可能具有更高的评价加和结果。
步骤203:响应于交互状态为第一交互状态,利用预设的知识库将答案语义改写为标准长度的标准答案信息;
在步骤201的基础上,本步骤旨在由上述执行主体在确定目标用户当前处于第一交互状态的情况下,利用预设的知识库将答案语义改写为标准长度的标准答案信息。例如,执行主体可以将答案语义分词后,从预设的知识库中提取与该分词对应的实体词,以进行替换,构造标准长度的标准答案信息。在一些实施例中,预设的知识库中也可以直接配置多条标准长度的(参考)标准答案信息,然后执行主体可以基于这些(参考)标准答案信息与答案语义的比较结果(例如,相似度超过预设的相似度阈值,且相似度在各个比较结果中最高的知识库中的标准答案信息),来确定标准答案信息。
在本实施例的一些可选的实现方式中,执行主体也可以通过预先训练过改写模型,来对答案语义进行改写,以得到“标准答案信息”。相应地,该“标准答案信息”可以被视为能够满足一般的阅读要求,使得用户能够清晰地理解的答复内容。相应地,其长度也可以被视为答案信息提供给用户的“标准长度”(其通常不是能满足底线清晰度要求的最小长度,但其通常是能够满足阅读清晰度、舒适度,而不容易发生歧义的“普通、一般”长度)。
步骤204:向目标用户播放标准答案信息。
本步骤旨在由执行主体将基于上述步骤203得到的标准答案信息播放给目标用户。例如执行主体为服务器的情况下,其可以将该标准答案信息推送回收集到目标用户的问题信息的“终端设备”,并利用该“终端设备”来播放标准答案信息,来将标准答案信息答复至目标用户。
本公开实施例提供的问答处理方法,在针对用户的问题寻找答案、提供答案的过程中,能够基于用户的交互状态,对答案的内容形式进行调整,以帮助用户更为容易地接受、理解答案,提升与用户的交互、答复质量,增强用户的交互体验。
在一些实施例中,如果确定出交互状态为第二交互状态,示例性地,其可以是上述的“急躁”的情绪状态。相应地,执行主体可以响应于交互状态为第二交互状态,首先仍如上文所讨论的利用预设的知识库将答案语义改写为标准长度的标准答案信息。
然后,执行主体选择基于对标准答案信息中至少一个非实体词和/或低于预设实体等级的实体词的删除和/或替换,生成长度小于标准答案信息的第一改写答案信息。
具体地,执行主体可以选择对标准答案进行例如切词处理,然后基于切词结果确定各个分词是否为实体,以及为实体的分词所对应的实体等级(其中,对答案的语义理解影响越大的实体可以具有更高的实体等级,例如,在上述天气的示例中,因为目标用户已经明确地指明日期为“明天”,所以对于用于表征日期的“明天”的实体等级则会低于表征天气结果的“晴”的实体等级,相应地,“明天”则可以因为低于预设实体等级而被删除)。
然后,执行主体可以选择将非实体词和/或低于预设实体等级的实体词的删除,或者更新非实体词和实体词的表述形式(例如,利用含义相近的,但字符更短的词作为替换)。例如,对于购物场景中,如果问题信息是与价格相关的问题,例如,产品A的价格。如果标准答案信息“为1个产品A,X1元,3个产品A,X2元”的情况下,则执行主体可以通过例如删除非实体词“一个”的改写来得到“X1元,3个,X2元”的第一改写答案信息。由此,通过这样的改写方式,能够通过缩短“标准长度”的方式来得到更容易被目标用户所快速阅读的改写方案。
相应地,执行主体可以针对问题信息,来为目标用户提供、播放该第一改写答案信息。由此,以方便目标用户更为快速地完成信息获取,避免因提供了可能存在“冗余”的内容,而使得目标用户产生更多的“负面情绪”,提升目标用户的交互体验。
在本实施例的一些可选的实现方式中,对于目标用户可能长期处于目标交互状态的情况下(例如,“急躁”的交互状态)的情况下,执行主体还可以选择例如主动介入、提供安抚的方式,来期望为目标用户提供关怀。具体而言,执行主体还可以响应于在预设时长内确定目标用户处于目标交互状态的次数等于预设的数量阈值,向目标用户播放预设的安抚语音信息。
为方便理解,继续基于上述的以第二交互状态代表“急躁”的情绪状态、交互状态的情况进行示例。执行主体在每次检测到目标用户处于第二交互状态的情况下,可以以当前时间为基点(或者,预设时长的终点位置),来寻找在历史时间内的该预设时间内目标用户处于第二交互状态的次数。如果目标用户处于第二交互状态的次数等于预设的数量阈值(通常,可以基于预先确定的认为需要进行“介入”的次数来被确定),向目标用户播放预设的安抚语音信息。在一些实施例中,安抚语音信息可以通过与目标用户的交互,由目标用户来提供(例如,目标用户所提供的,其所认为可能产生“安抚”作用的语音内容)。在一些实施例中,安抚语音信息也可以基于对问答处理方法的服务提供商来预先配置。
由此,在目标用户可能长期处于“急躁”的情况下,执行主体可以积极、主动地“介入”安抚,以丰富交互功能的同时,提升与用户之间的用户的交互体验,为用户提供关怀。
在一些实施例中,如果确定出交互状态为第三交互状态,示例性地,其可以是上述的“谨慎”的情绪状态。相应地,执行主体可以响应于交互状态为第三交互状态,首先仍如上文所讨论的利用预设的知识库将答案语义改写为标准长度的标准答案信息。
然后,执行主体通过在标准答案信息中插入至少一个话术内容,生成长度大于第一答案信息第二改写答案信息。在一些实施例中,该话术内容可以是针对标准答案信息中某个实体词进一步的详细解释。例如,执行主体可以基于与大量历史用户的历史问答结果分析标准答案信息中需要被进一步解释的词语,例如,执行主体可以通过大量历史用户的二轮询问对话、追问对话中所指向的词语,来确定“容易”被追问的词语,然后在标准答案信息中存在这样的词语的情况下,主动地将对应该词语的进一步解释作为话术内容,插入至标准答案信息中。在一些实施例中,该话术内容也可以是一些具有安抚、平和语气作用的词语、句子。
相应地,执行主体可以通过在标准答案信息插入这些话术内容的方式,来增加答复内容的质量,并使得其至少在语气上能够“更平易近人”。由此,以达到“缓解目标用户的谨慎、紧张”的作用。相应地,执行主体可以针对问题信息,来为目标用户提供、播放该第二改写答案。由此,通过提供内容更为丰富、阅读更为“温情”的(改写)答案信息,来缓解用户的“紧张、谨慎情绪”,提升用户的交互体验。
在本实施例的一些可选的实现方式中,为了更便捷、效率地确定话术内容,同样可以预先维护、设置一个话术资料库,以使得执行主体可以利用该话术资料库来确定话术内容。例如,针对“安抚”功能,可以预先收集、设置一些具有安抚功能的词和句子后,得到该话术资料库。
然后,执行主体可以选择基于本地与目标用户的历史对话内容与预设的话术资料库中参考话术内容的相似匹配结果确定实际使用的话术内容。例如,执行主体可以分别将话术资料库中的各个参考话术内容与目标用户所提供的历史对话内容进行比较(为了提升比较效率,该历史对话同样可以是基于用户所提供的,其认为具有“安抚”作用的对话内容),然后,将话术资料库中,与历史对话内容中由目标用户提供的目标对话内容的相似度超过预设的相似度阈值且相似度最高的参考话术内容确定为被使用的目标参考话术内容,以将其作为插入标准答案信息时所使用的话术内容。
由此,通过这样的方式,能够基于目标用户的语言习惯,来寻找更贴合其情感价值需求、更容易被其所理解的“话术内容”,提升话术内容的选择质量。
应当理解的是,上述的第一交互状态、第二交互状态和第三交互状态所对应的“情绪状态”,仅是为了区分三个不同的交互的状态所进行的示例。为方便理解,在本文本中,仅是示例性地以第一交互状态示例、指代上文所讨论的“情绪平稳的普通情绪状态”,以第二交互状态示例、指代上文所讨论的“急躁”的情绪状态,以第三交互状态示例、指代上文所讨论的“疑惑”、“谨慎”的情绪状态。在一些场景中,这样的对应关系也可以被视为作为执行主体的“默认”配置。
而相应地,这样的“默认”配置可以基于用户的需求,实际情况来被调整。例如,在一些场景中,用户可能更期望在其被确定为“急躁”状态下来获取内容更为丰富的“第二改写答案”。相应地,在一些实施例中,执行主体也可以基于与目标用户所通信、交互的方式,允许目标用户调整第一交互状态、第二交互状态和第三交互状态所实际的“含义”。简言之,目标用户可以通过与执行主体的交互,来调整执行主体对于第一交互状态、第二交互状态和第三交互状态的确定和识别标准。
示例性地,在目标用户的偏好中,其可能更期望在“急躁”的情绪状态下来获取标准长度的标准答案信息,则目标用户可以选择将第一交互状态的实际含义调整为“急躁”的情绪状态,或者说,将执行主体确定其属于“急躁”的状态确定为第一交互状态。类似地,如果目标用户期望在“情绪平稳的普通情绪状态”下获取内容更多的,具有更详细解释的和/或具有安抚倾向内容的第二改写答案信息的情况下,目标用户可以调整第三交互状态为“情绪平稳的普通的”情绪状态。
相应地,在一些实施例中,如上文所讨论的,对于第一交互状态、第二交互状态和第三交互状态的划分“界限”,也同样是可以基于实际场景的需求而被适应性调整的。相应地,对于交互状态所对应的“具体状态”其也可以被按照不同的标准划分。例如,对于上述的“谨慎”状态,其还可以被“沮丧”状态所替代,示例性地,在第三交互状态为“沮丧”的情况下,执行主体同样可以通过增加话术的方式,来为用户提供“安抚”,以期望其能够摆脱“沮丧”的交互状态。
此外,应当理解的是,如果在实际使用情况下,执行主体根据目标用户的指示对各个交互状态进行了调整,以使得第一交互状态、第二交互状态和第三交互状态的内容与上述所示例的内容不同,则对于某些实施例的实现过程,也会产生适应性地调整。例如,针对上文所示例的以“第二交互状态”作为“目标交互状态”的情况,如果用户将第一交互状态调整为“急躁”,则执行主体可以适应性地将“目标交互状态”确定为第一交互状态。例如,执行主体可以对目标用户所设置“交互状态”时所提供的例如上述分值加和结果、参数、情绪分类结果,来确定“目标交互状态”。例如,执行主体可以将认为属于“负面情绪”的交互状态均确定为目标交互状态。
在一些实施例中,执行主体也可以根据目标用户的设置,来选择属于目标交互状态的交互状态。
在一些实施例中,在确定目标用户所处的交互状态的过程中,执行主体还可以选择联合目标用户提供问题信息过程中的面部动作识别结果和针对问题信息的语气识别结果,来确定目标用户当前所处的交互状态。
具体地,执行主体可以通过人脸表情识别(Face Reader,简称FER)技术,来对目标用户提供问题信息过程中的面部动作进行识别,得到识别结果。例如,执行主体可以通过对面部中眼睛、眉毛、嘴、面部肌肉等关键点的动作变化,来基于面部动作确定出第一个子交互状态,然后再将其与上文所讨论的,针对语音所确定出的另一个子交互状态进行结合,来得到最终的识别结果,即,目标用户当前所处的交互状态。由此,通过面部动作和语音两方面的识别路径,来更为准确地准确目标用户的交互状态。
在一些实施例中,执行在向用户播放答案(例如,标准答案信息、第一改写答案信息或第二改写答案信息)的过程中,还可以基于所确定出的交互状态,来进一步地对播放时所采用的语音播放参数进行调整。语音播放参数包括以下中的至少一种:音量参数、语速参数、语气参数。例如,同样可以通过例如上文的由用户,或者由问答服务的服务提供方,来配置上述语音播放参数的方式来确定该语音播放参数。
在一些实施例中,在针对交互状态确定语音播放参数的过程中,所使用的音量参数、语速参数、语气参数的逻辑可以与确定交互状态时相反。例如,对于被确定出“急躁”的交互状态,可以在确定该交互状态对应的语音播放参数时,反而使用音量低、语速慢、语气平缓的语音播放参数为其播放答案信息(例如,第一改写答案信息)。由此,以在播放过程中,进一步地照顾目标用户的情绪状态,提升用户的使用体验。
相应地,执行主体在确定语音播放参数后,可以基于语音播放参数,向目标用户播放对应的答案信息(例如,标准答案信息、第一改写答案信息或第二改写答案信息)。
进一步地,为了提升执行主体的使用场景,丰富其能力,其还可以被配置对于一些特殊的问题信息的特有回答能力。例如,其可以被配置为对于健康状态询问信息的回答能力(例如,这样的回答能力可以是基于对用户的身体指标的分析结果来被提供的)。
请参考图3,图3为本公开实施例提供的一种确定答案语义的过程的流程图,其可以应用于问题信息为目标用户的健康状态询问信息的场景中。图3中包括流程300,流程300可以在问题信息为目标用户的健康状态询问信息的场景中,作为上述步骤201的备选或替代,流程300具体包括如下步骤:
步骤301:响应于接收到目标用户通过语音形式提供的问题信息,向目标用户发出获取目标用户的身体指标的获取请求;
具体地,执行主体在接收到目标用户通过语音形式提供的问题信息的情况下对此响应,向目标用户发出获取目标用户的身体指标的获取请求。例如,执行主体可以通过语音交互的形式,或者通过显示器来为目标用户提供询问信息,以向目标用户发出获取目标用户的身体指标的获取请求。
在一些实施例中,执行主体发出的该获取请求中,还可以明确地包括所期望获取的各项身体指标的具体内容,以便于目标用户更为精细化地进行授权,保护目标用户的隐私。
步骤302:响应于接收到目标用户针对获取请求返回授权指令,基于预设的第一通信路径,获取身体指标清单;
具体地,如果目标用户确认授权,则其可以向执行主体返回授权指令(例如,语音形式的授权指令,或者在显示器中对询问信息中所提供的“确认控件”的点击操作)。相应地,执行主体响应于接收到目标用户针对获取请求返回授权指令,基于预设的第一通信路径,获取身体指标清单。
身体指标清单中可以包括针对目标用户的至少一项身体指标(例如,血压、脉搏、尿酸等等)。第一通信路径可以是用于存放目标用户的身体指标的终端设备,例如,其可以是医疗机构的存储设备、目标用户所使用的终端设备等等。在一些实施例中,如果在执行主体的本地存储中存储由上述身体指标清单,该第一通信路径也可以是执行主体的内部路径,以使得执行主体在本地直接获取该“身体指标清单”。
应当理解的是,身体指标清单可以以多个部分的方式来被分别地存储在上述的各个主体中,相应地,执行主体可以分别通过与这些主体的通信来获取完整的“身体指标清单”。
步骤303:基于对身体指标清单中各项身体指标的评价结果,确定问题信息的答案语义。
具体地,执行主体在基于上述步骤302获取到“身体指标清单”后,可以基于各项身体指标与各自所对应的预设的参考阈值的数值关系来确定各项身体指标对应的评价结果。例如,在血压高于对应的血压阈值的情况下,其可以确定对于身体指标“血压”的评价结果(例如,血压不健康)。然后,执行主体可以基于各项身体指标的评价结果,来综合地确定问题信息的答案语义。例如,在身体指标为10项的情况下,如果执行主体确定其中9项均处于“不健康”状态(即,这9项均不符合各自对应的阈值的要求),则执行主体可以确定问题信息的答案语义为“用户当前处于不健康状态”。应当理解的是,上述9、10的描述仅出于示例性目的,而不旨在对此进行限制。
在一些实施例中,执行主体还可以基于具体处于不健康状态的指标的,来进一步地细化、丰富答案语义。例如,“用户当前处于血压超标所导致的不健康状态”等等。
由此,可以在经过用户授权的情况下,基于用户的身体指标为其提供健康监控服务,来满足用户的照料需求。
在本实施例的一些可选的实现方式中,在执行主体确定答案语义指示目标用户当前处于目标健康状态的情况下,执行主体可以对此响应,基于预设的第二通信路径,向目标用户设备通信目标健康状态。目标用户设备可以是预先录入的,与目标用户存在照料、帮助等关系的其他用户,例如,目标设备可以是医疗机构、救助机构等机构的通信设备,也可以是目标用户的亲属所使用的设备等等。
由此,以使得这些主体能够及时、同步地了解目标用户状态,使得一些例如个性化需求为可能需要更多精力来被帮助和照顾的个性化、特殊用户群体能够更为充分地得到“关怀”。
相应地,目标健康状态也可以基于目标用户和/或这些接收主体的需求来被配置,例如,目标健康可以是确定“处于不健康状态”,以使得在确定例如上述需要更多精力来被帮助和照顾的目标用户可能处于不健康状态下,更迅速地将该情况同步给各个主体,以使得各个主体能够尽早、更及时地为该目标用户提供帮助。
在上述任一实施例的基础上,还可以通过引入生成式语言模型(GeneralLanguage Model,简称GLM)的方式来提升交互效果,提升交互质量。例如,在确定交互状态,确定答案语义,以及对答案语义进行改成的过程中,均可以通过使用GLM的方式,来提升处理效率和处理质量。
GLM属于大语言模型(Large Language Model,简称LLM)的一种,LLM也可以被称为大型语言模型,其是一种人工智能模型,旨在理解和生成人类语言。并且,生成式语言模型可以基于其理解的内容,相应地执行处理操作,以得到对应的处理结果。相应地,也可以利用其他类型的LLM来等同地实现GLM所实现的处理过程,此处仅针对GLM进行讨论。
LLM的特点是规模庞大,通常其可以包括大量的参数,以帮助它们学习语言数据中的复杂模式。这些模型通常基于深度学习架构,如转化器,这有助于它们在各种NLP任务上提供更好的处理性能。
在本公开的实施例中,执行主体还可以选择获取生成式语言模型。生成式语言模型至少被配置成利用预设的知识库将答案语义改写为标准长度的标准答案信息。例如,生成式语言模型可以预先被训练,使得其具有利用预设的知识库将答案语义改写为标准长度的标准答案信息的能力。在此情况下,执行主体可以基于预先配置的引导词、引导标签等,来指示利用预设的知识库将答案语义改写为标准长度的标准答案信息。例如,在被指示利用预设的知识库将答案语义改写为标准长度的标准答案信息的场景中,引导词可以是例如:基于预设的知识库,来将“XXX”改写为对于“问题信息”的答案。
类似地,对于生成式语言模型,其可以通过被默认配置的方式,以省略“引导词”。例如,对于利用预设的知识库将答案语义改写为标准长度的标准答案信息这一目的,生成式语言模型中可以基于默认的配置,当然地理解需要利用预设的知识库将答案语义改写为标准长度的标准答案信息。由此,以通过默认配置的方式,使得生成式语言模型能够稳定、定向地利用预设的知识库将答案语义改写为标准长度的标准答案信息。由此,可以利用生成式语言模型来更效率、质量地利用预设的知识库将答案语义改写为标准长度的标准答案信息。通常,该“标准答案”所对应的“标准”,同样可以通过对GLM的预先训练,使其“学习”得到。
相应地,在一些实施例中,执行主体也可以类似地利用GLM来确定目标用户的交互状态、生成第一改写答案信息、第二改写答案信息和确定针对标准答案信息的语音播放参数。例如,执行主体可以通过指示GLM实现大量用户的数据分析,来确定语速与状态之间的对应关系的过程。
例如,期望主要为“个性化用户”提供上述问答处理方法的过程中,可以选择通过互联网、书本资料以及人工调研,来针对个性化用户、对应的参考用户的日常生活、兴趣爱好等,重点获取语音情绪特征建模数据、人脸情感标签数据。对于话术内容,可以通过从允许被获取数据的、公开渠道中(例如,社交媒体、聚集参考用户的用户论坛、健康养生网站等互联网平台)获取用户参考的话术内容,以分析“个性化用户”更喜欢使用的话术内容等等。
然后,基于对这些数据进行清洗(例如,利用哈希算法或相似度比较技术识别和删除重复的数据记录。例如,针对数据中的缺失值,数据的分布情况和相关性分析,采用均值填充、多重插补或基于机器学习的预测模型等方法进行填补。例如,对于异常值,利用统计方法如IQR法则或Z-score进行识别,并根据实际情况进行修正或剔除)后,基于清洗的数据对GLM进行训练,以使得GLM具有在相应场景下的处理能力、能够提供满足需求的数据处理能力(例如,能确定出更适合个性化用户去阅读的话术内容)。
为加深理解,本公开还结合一个具体应用场景,给出了一种具体的实现方案,请参见如图4所示的流程400。为方便理解,将部分地结合图1所示出的示例性系统架构100进行说明。
在流程400中,例如存在上述个性化需求的用户106可以与终端设备103通过语音的形式进行交互。相应地,终端设备103可以基于与服务器105的通信,来获取处理能力的支持(例如,问答处理能力的支持)。
如流程400所示出,用户106首先可以执行S401,来与终端设备103进行交互,以语音形式来提供问题信息410。
然后,终端设备103可以执行S402,来将接收到的问题信息410提供至服务器105,以利用服务器105的处理能力来处理该问题信息410,为用户106提供问答服务。
服务器105在接收到该问题信息410后,可以执行S403,来利用GLM来确定问题信息410所对应的答案语义415。例如,上文所说明的,服务器105可以基于获取到的问题信息410来构建引导词“请确定问题信息410所对应的答案语义”,来指示GLM生成答案语义415。
接下来,服务器105继续执行S404,来利用GLM确定出用户106当前所的交互状态420(例如,其可以是上文所讨论的第一交互状态、第二交互状态或第三交互状态中的一种)。服务器105可以类似地通过构建引导词的方式,来指示GLM确定基于问题信息410所对应的语音段,来确定用户106当前所处的交互状态420,此处不再重复说明。
在得到交互状态420后,执行主体可以基于选择执行S405,来对答案语义415进行改写,以得到改写后的答案信息430。在该过程中,如上文所讨论的,执行主体可以基于对应于交互状态的改写策略(例如,最终改写为标准长度的标准答案信息,最终改写为第一改写答案信息,或者最终改写为第二改写答案信息),基于所确定出的交互状态420确定将答案语义415改写为上述三者之一,以得到改写后的答案信息430。
为方便理解,示例性地,对于第一交互状态所得到的标准长度的标准答案信息可以被示例为“YYYYY”,第一改写答案信息可以被示例为“YYYY”,第二改写答案信息可以被示例为“YYYYYYYY”。
示例性地,在过程400中,示例交互状态420被确定为“第二交互状态”,则相应地改写后的答案信息430的形式可以被示例为“YYYY”。
接下来,服务器105可以执行S406,来将改写后的答案信息430返回至终端设备103。
最后,终端设备103将改写后的答案信息430播放给用户106,来针对其所提供的问题信息410进行“回答”。
进一步参考图5,作为对上述各图所示方法的实现,本公开提供了一种问答处理装置的一个实施例,该装置实施例与图2所示的方法实施例相对应,该装置具体可以应用于各种电子设备中。
如图5所示,本实施例的问答处理装置500可以包括:答案语义确定单元501、交互状态确定单元502、第一答案改写单元503和第一答案发送单元504。其中,答案语义确定单元501,被配置成基于目标用户通过语音形式提供的问题信息,确定问题信息的答案语义;交互状态确定单元502,被配置成至少基于针对问题信息的语气识别结果,确定目标用户当前所处的交互状态;第一答案改写单元503,被配置成响应于交互状态为第一交互状态,利用预设的知识库将答案语义改写为标准长度的标准答案信息;第一答案发送单元504,被配置成向目标用户播放标准答案信息。
在本实施例中,问答处理装置500中:答案语义确定单元501、交互状态确定单元502、第一答案改写单元503和第一答案发送单元504的具体处理及其所带来的技术效果可分别参考图2对应实施例中的步骤201-204的相关说明,在此不再赘述。
在本实施例的一些可选的实现方式中,装置500还包括:第二答案改写单元,被配置成响应于交互状态为第二交互状态,利用预设的知识库将答案语义改写为标准长度的标准答案信息;第三答案改写单元,被配置成基于对标准答案信息中至少一个非实体词和/或低于预设实体等级的实体词的删除和/或替换,生成第一改写答案信息,其中,第一改写答案信息的长度小于标准答案信息;第二答案发送单元,被配置成向目标用户播放第一改写答案信息。
在本实施例的一些可选的实现方式中,装置500还包括:安抚语音播放单元,被配置成响应于在预设时长内确定目标用户处于目标交互状态的次数等于预设的数量阈值,向目标用户播放预设的安抚语音信息。
在本实施例的一些可选的实现方式中,装置500还包括:第四答案改写单元,被配置成响应于交互状态为第三交互状态,利用预设的知识库将答案语义改写为标准长度的标准答案信息;第五答案改写单元,被配置成通过在标准答案信息中插入至少一个话术内容,生成第二改写答案信息,其中,第二改写答案信息的长度大于第一答案信息;以及第三答案发送单元,被配置成向目标用户播放第二改写答案信息。
在本实施例的一些可选的实现方式中,话术内容基于本地与目标用户的历史对话内容与预设的话术资料库中参考话术内容的相似匹配结果被确定,其中,话术内容为被记载于话术资料库中,且与历史对话内容中由目标用户提供的目标对话内容的相似度大于等于预设的相似度阈值的目标参考话术内容。
在本实施例的一些可选的实现方式中,交互状态确定单元502,进一步被配置成,基于目标用户提供问题信息过程中的面部动作识别结果,以及针对问题信息的语气识别结果,确定目标用户当前所处的交互状态。
在本实施例的一些可选的实现方式中,第一答案发送单元504,包括:语音参数确定子单元,被配置成基于交互状态确定针对标准答案信息的语音播放参数,其中,语音播放参数包括以下中的至少一种:音量参数、语速参数、语气参数;答案发送子单元,被配置成基于语音播放参数,向目标用户播放标准答案信息。
在本实施例的一些可选的实现方式中,问题信息为目标用户的健康状态询问信息,答案语义确定单元501,包括:指标请求获取子单元,被配置成响应于接收到目标用户通过语音形式提供的问题信息,向目标用户发出获取目标用户的身体指标的获取请求;指标清单获取子单元,被配置成响应于接收到目标用户针对获取请求返回授权指令,基于预设的第一通信路径,获取身体指标清单;答案语义确定子单元,被配置成基于对身体指标清单中各项身体指标的评价结果,确定问题信息的答案语义,其中,评价结果基于各项身体指标与各自所对应的预设的参考阈值的数值关系被确定。
在本实施例的一些可选的实现方式中,装置500还包括:健康状态通信单元,被配置成响应于答案语义指示目标用户当前处于目标健康状态,基于预设的第二通信路径,向目标用户设备通信目标健康状态。
在本实施例的一些可选的实现方式中,标准答案信息由生成式语言模型改写答案语义得到。
本实施例作为对应于上述方法实施例的装置实施例存在,本实施例提供的问答处理装置,在针对用户的问题寻找答案、提供答案的过程中,能够基于用户的交互状态,对答案的内容形式进行调整,以帮助用户更为容易地接受、理解答案,提升与用户的交互、答复质量,增强用户的交互体验。
根据本公开的实施例,本公开还提供了一种电子设备、一种可读存储介质和一种计算机程序产品。
图6示出了可以用来实施本公开的实施例的示例电子设备600的示意性框图。电子设备旨在表示各种形式的数字计算机,诸如,膝上型计算机、台式计算机、工作台、个人数字助理、服务器、刀片式服务器、大型计算机、和其它适合的计算机。电子设备还可以表示各种形式的移动装置,诸如,个人数字处理、蜂窝电话、智能电话、可穿戴设备和其它类似的计算装置。本文所示的部件、它们的连接和关系、以及它们的功能仅仅作为示例,并且不意在限制本文中描述的和/或者要求的本公开的实现。
如图6所示,设备600包括计算单元601,其可以根据存储在只读存储器(ROM)602中的计算机程序或者从存储单元608加载到随机访问存储器(RAM)603中的计算机程序,来执行各种适当的动作和处理。在RAM 603中,还可存储设备600操作所需的各种程序和数据。计算单元601、ROM 602以及RAM 603通过总线604彼此相连。输入/输出(I/O)接口605也连接至总线604。
设备600中的多个部件连接至I/O接口605,包括:输入单元606,例如键盘、鼠标等;输出单元607,例如各种类型的显示器、扬声器等;存储单元608,例如磁盘、光盘等;以及通信单元609,例如网卡、调制解调器、无线通信收发机等。通信单元609允许设备600通过诸如因特网的计算机网络和/或各种电信网络与其他设备交换信息/数据。
计算单元601可以是各种具有处理和计算能力的通用和/或专用处理组件。计算单元601的一些示例包括但不限于中央处理单元(CPU)、图形处理单元(GPU)、各种专用的人工智能(AI)计算芯片、各种运行机器学习模型算法的计算单元、数字信号处理器(DSP)、以及任何适当的处理器、控制器、微控制器等。计算单元601执行上文所描述的各个方法和处理,例如问答处理方法。例如,在一些实施例中,问答处理方法可被实现为计算机软件程序,其被有形地包含于机器可读介质,例如存储单元608。在一些实施例中,计算机程序的部分或者全部可以经由ROM 602和/或通信单元609而被载入和/或安装到设备600上。当计算机程序加载到RAM 603并由计算单元601执行时,可以执行上文描述的问答处理方法的一个或多个步骤。备选地,在其他实施例中,计算单元601可以通过其他任何适当的方式(例如,借助于固件)而被配置为执行问答处理方法。
本文中以上描述的系统和技术的各种实施方式可以在数字电子电路系统、集成电路系统、场可编程门阵列(FPGA)、专用集成电路(ASIC)、专用标准产品(ASSP)、芯片上系统的系统(SOC)、负载可编程逻辑设备(CPLD)、计算机硬件、固件、软件、和/或它们的组合中实现。这些各种实施方式可以包括:实施在一个或者多个计算机程序中,该一个或者多个计算机程序可在包括至少一个可编程处理器的可编程系统上执行和/或解释,该可编程处理器可以是专用或者通用可编程处理器,可以从存储系统、至少一个输入装置、和至少一个输出装置接收数据和指令,并且将数据和指令传输至该存储系统、该至少一个输入装置、和该至少一个输出装置。
用于实施本公开的方法的程序代码可以采用一个或多个编程语言的任何组合来编写。这些程序代码可以提供给通用计算机、专用计算机或其他可编程数据处理装置的处理器或控制器,使得程序代码当由处理器或控制器执行时使流程图和/或框图中所规定的功能/操作被实施。程序代码可以完全在机器上执行、部分地在机器上执行,作为独立软件包部分地在机器上执行且部分地在远程机器上执行或完全在远程机器或服务器上执行。
在本公开的上下文中,机器可读介质可以是有形的介质,其可以包含或存储以供指令执行系统、装置或设备使用或与指令执行系统、装置或设备结合地使用的程序。机器可读介质可以是机器可读信号介质或机器可读储存介质。机器可读介质可以包括但不限于电子的、磁性的、光学的、电磁的、红外的、或半导体系统、装置或设备,或者上述内容的任何合适组合。机器可读存储介质的更具体示例会包括基于一个或多个线的电气连接、便携式计算机盘、硬盘、随机存取存储器(RAM)、只读存储器(ROM)、可擦除可编程只读存储器(EPROM或快闪存储器)、光纤、便捷式紧凑盘只读存储器(CD-ROM)、光学储存设备、磁储存设备、或上述内容的任何合适组合。
为了提供与用户的交互,可以在计算机上实施此处描述的系统和技术,该计算机具有:用于向用户显示信息的显示装置(例如,CRT(阴极射线管)或者LCD(液晶显示器)监视器);以及键盘和指向装置(例如,鼠标或者轨迹球),用户可以通过该键盘和该指向装置来将输入提供给计算机。其它种类的装置还可以用于提供与用户的交互;例如,提供给用户的反馈可以是任何形式的传感反馈(例如,视觉反馈、听觉反馈、或者触觉反馈);并且可以用任何形式(包括声输入、语音输入或者、触觉输入)来接收来自用户的输入。
可以将此处描述的系统和技术实施在包括后台部件的计算系统(例如,作为数据服务器)、或者包括中间件部件的计算系统(例如,应用服务器)、或者包括前端部件的计算系统(例如,具有图形用户界面或者网络浏览器的用户计算机,用户可以通过该图形用户界面或者该网络浏览器来与此处描述的系统和技术的实施方式交互)、或者包括这种后台部件、中间件部件、或者前端部件的任何组合的计算系统中。可以通过任何形式或者介质的数字数据通信(例如,通信网络)来将系统的部件相互连接。通信网络的示例包括:局域网(LAN)、广域网(WAN)和互联网。
计算机系统可以包括客户端和服务器。客户端和服务器一般远离彼此并且通常通过通信网络进行交互。通过在相应的计算机上运行并且彼此具有客户端-服务器关系的计算机程序来产生客户端和服务器的关系。服务器可以是云服务器,又称为云计算服务器或云主机,是云计算服务体系中的一项主机产品,以解决传统物理主机与虚拟专用服务器(VPS,Virtual Private Server)服务中存在的管理难度大,业务扩展性弱的缺陷。服务器也可以分为分布式系统的服务器,或者是结合了区块链的服务器。
根据本公开实施例的技术方案,在针对用户的问题寻找答案、提供答案的过程中,能够基于用户的交互状态,对答案的内容形式进行调整,以帮助用户更为容易地接受、理解答案,提升与用户的交互、答复质量,增强用户的交互体验。
应该理解,可以使用上面所示的各种形式的流程,重新排序、增加或删除步骤。例如,本公开中记载的各步骤可以并行地执行也可以顺序地执行也可以不同的次序执行,只要能够实现本公开提供的技术方案所期望的结果,本文在此不进行限制。
上述具体实施方式,并不构成对本公开保护范围的限制。本领域技术人员应该明白的是,根据设计要求和其他因素,可以进行各种修改、组合、子组合和替代。任何在本公开的精神和原则之内所作的修改、等同替换和改进等,均应包含在本公开保护范围之内。

Claims (23)

1.一种问答处理方法,包括:
基于目标用户通过语音形式提供的问题信息,确定所述问题信息的答案语义;
至少基于针对所述问题信息的语气识别结果,确定所述目标用户当前所处的交互状态;
响应于所述交互状态为第一交互状态,利用预设的知识库将所述答案语义改写为标准长度的标准答案信息;
向所述目标用户播放所述标准答案信息。
2.根据权利要求1所述的方法,还包括:
响应于所述交互状态为第二交互状态,利用预设的知识库将所述答案语义改写为标准长度的标准答案信息;
基于对所述标准答案信息中至少一个非实体词和/或低于预设实体等级的实体词的删除和/或替换,生成第一改写答案信息,其中,所述第一改写答案信息的长度小于所述标准答案信息;
向所述目标用户播放所述第一改写答案信息。
3.根据权利要求1所述的方法,还包括:
响应于在预设时长内确定所述目标用户处于目标交互状态的次数等于预设的数量阈值,向所述目标用户播放预设的安抚语音信息。
4.根据权利要求1所述的方法,还包括:
响应于所述交互状态为第三交互状态,利用预设的知识库将所述答案语义改写为标准长度的标准答案信息;
通过在所述标准答案信息中插入至少一个话术内容,生成第二改写答案信息,其中,所述第二改写答案信息的长度大于所述第一答案信息;以及
向所述目标用户播放所述第二改写答案信息。
5.根据权利要求4所述的方法,其中,所述话术内容基于本地与所述目标用户的历史对话内容与预设的话术资料库中参考话术内容的相似匹配结果被确定,其中,所述话术内容为被记载于所述话术资料库中,且与所述历史对话内容中由所述目标用户提供的目标对话内容的相似度大于等于预设的相似度阈值的目标参考话术内容。
6.根据权利要求1所述的方法,其中,所述至少基于针对所述问题信息的语气识别结果,确定所述目标用户当前所处的交互状态,包括:
基于所述目标用户提供所述问题信息过程中的面部动作识别结果,以及针对所述问题信息的语气识别结果,确定所述目标用户当前所处的交互状态。
7.根据权利要求1所述的方法,其中,所述向所述目标用户播放所述标准答案信息,包括:
基于所述交互状态确定针对所述标准答案信息的语音播放参数,其中,所述语音播放参数包括以下中的至少一种:音量参数、语速参数、语气参数;
基于所述语音播放参数,向所述目标用户播放所述标准答案信息。
8.根据权利要求1所述的方法,其中,所述问题信息为所述目标用户的健康状态询问信息,所述基于目标用户通过语音形式提供的问题信息,确定所述问题信息的答案语义,包括:
响应于接收到所述目标用户通过语音形式提供的问题信息,向所述目标用户发出获取所述目标用户的身体指标的获取请求;
响应于接收到所述目标用户针对所述获取请求返回授权指令,基于预设的第一通信路径,获取所述身体指标清单;
基于对所述身体指标清单中各项身体指标的评价结果,确定所述问题信息的答案语义,其中,所述评价结果基于所述各项身体指标与各自所对应的预设的参考阈值的数值关系被确定。
9.根据权利要求8所述的方法,还包括:
响应于所述答案语义指示所述目标用户当前处于目标健康状态,基于预设的第二通信路径,向目标用户设备通信所述目标健康状态。
10.根据权利要求1-9中任一项所述的方法,其中,所述标准答案信息由生成式语言模型改写所述答案语义得到。
11.一种问答处理装置,包括:
答案语义确定单元,被配置成基于目标用户通过语音形式提供的问题信息,确定所述问题信息的答案语义;
交互状态确定单元,被配置成至少基于针对所述问题信息的语气识别结果,确定所述目标用户当前所处的交互状态;
第一答案改写单元,被配置成响应于所述交互状态为第一交互状态,利用预设的知识库将所述答案语义改写为标准长度的标准答案信息;
第一答案发送单元,被配置成向所述目标用户播放所述标准答案信息。
12.根据权利要求11所述的装置,还包括:
第二答案改写单元,被配置成响应于所述交互状态为第二交互状态,利用预设的知识库将所述答案语义改写为标准长度的标准答案信息;
第三答案改写单元,被配置成基于对所述标准答案信息中至少一个非实体词和/或低于预设实体等级的实体词的删除和/或替换,生成第一改写答案信息,其中,所述第一改写答案信息的长度小于所述标准答案信息;
第二答案发送单元,被配置成向所述目标用户播放所述第一改写答案信息。
13.根据权利要求12所述的装置,还包括:
安抚语音播放单元,被配置成响应于在预设时长内确定所述目标用户处于目标交互状态的次数等于预设的数量阈值,向所述目标用户播放预设的安抚语音信息。
14.根据权利要求11所述的装置,还包括:
第四答案改写单元,被配置成响应于所述交互状态为第三交互状态,利用预设的知识库将所述答案语义改写为标准长度的标准答案信息;
第五答案改写单元,被配置成通过在所述标准答案信息中插入至少一个话术内容,生成第二改写答案信息,其中,所述第二改写答案信息的长度大于所述第一答案信息;以及
第三答案发送单元,被配置成向所述目标用户播放所述第二改写答案信息。
15.根据权利要求14所述的装置,其中,所述话术内容基于本地与所述目标用户的历史对话内容与预设的话术资料库中参考话术内容的相似匹配结果被确定,其中,所述话术内容为被记载于所述话术资料库中,且与所述历史对话内容中由所述目标用户提供的目标对话内容的相似度大于等于预设的相似度阈值的目标参考话术内容。
16.根据权利要求11所述的装置,其中,所述交互状态确定单元,进一步被配置成,基于所述目标用户提供所述问题信息过程中的面部动作识别结果,以及针对所述问题信息的语气识别结果,确定所述目标用户当前所处的交互状态。
17.根据权利要求11所述的装置,其中,所述第一答案发送单元,包括:
语音参数确定子单元,被配置成基于所述交互状态确定针对所述标准答案信息的语音播放参数,其中,所述语音播放参数包括以下中的至少一种:音量参数、语速参数、语气参数;
答案发送子单元,被配置成基于所述语音播放参数,向所述目标用户播放所述标准答案信息。
18.根据权利要求11所述的装置,其中,所述问题信息为所述目标用户的健康状态询问信息,所述答案语义确定单元,包括:
指标请求获取子单元,被配置成响应于接收到所述目标用户通过语音形式提供的问题信息,向所述目标用户发出获取所述目标用户的身体指标的获取请求;
指标清单获取子单元,被配置成响应于接收到所述目标用户针对所述获取请求返回授权指令,基于预设的第一通信路径,获取所述身体指标清单;
答案语义确定子单元,被配置成基于对所述身体指标清单中各项身体指标的评价结果,确定所述问题信息的答案语义,其中,所述评价结果基于所述各项身体指标与各自所对应的预设的参考阈值的数值关系被确定。
19.根据权利要求18所述的装置,还包括:
健康状态通信单元,被配置成响应于所述答案语义指示所述目标用户当前处于目标健康状态,基于预设的第二通信路径,向目标用户设备通信所述目标健康状态。
20.根据权利要求10-19中任一项所述的装置,其中,所述标准答案信息由生成式语言模型改写所述答案语义得到。
21.一种电子设备,包括:
至少一个处理器;以及
与所述至少一个处理器通信连接的存储器;其中,
所述存储器存储有可被所述至少一个处理器执行的指令,所述指令被所述至少一个处理器执行,以使所述至少一个处理器能够执行权利要求1-10中任一项所述的问答处理方法。
22.一种存储有计算机指令的非瞬时计算机可读存储介质,所述计算机指令用于使所述计算机执行权利要求1-10中任一项所述的问答处理方法。
23.一种计算机程序产品,包括计算机程序,所述计算机程序在被处理器执行时实现根据权利要求1-10中任一项所述的问答处理方法。
CN202410797475.1A 2024-06-19 2024-06-19 问答处理方法、装置、设备、存储介质及程序产品 Pending CN118692450A (zh)

Priority Applications (1)

Application Number Priority Date Filing Date Title
CN202410797475.1A CN118692450A (zh) 2024-06-19 2024-06-19 问答处理方法、装置、设备、存储介质及程序产品

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
CN202410797475.1A CN118692450A (zh) 2024-06-19 2024-06-19 问答处理方法、装置、设备、存储介质及程序产品

Publications (1)

Publication Number Publication Date
CN118692450A true CN118692450A (zh) 2024-09-24

Family

ID=92764133

Family Applications (1)

Application Number Title Priority Date Filing Date
CN202410797475.1A Pending CN118692450A (zh) 2024-06-19 2024-06-19 问答处理方法、装置、设备、存储介质及程序产品

Country Status (1)

Country Link
CN (1) CN118692450A (zh)

Cited By (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN119961426A (zh) * 2025-04-11 2025-05-09 四川省肿瘤医院 基于放疗流程的人工智能问答系统
CN120671848A (zh) * 2025-06-23 2025-09-19 北京字跳网络技术有限公司 与生成式语言模型交互的方法、装置、设备、介质和产品

Citations (6)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2000207214A (ja) * 1999-01-20 2000-07-28 Victor Co Of Japan Ltd 対話装置
JP2004251998A (ja) * 2003-02-18 2004-09-09 Yukihiro Ito 対話理解装置
WO2020000867A1 (zh) * 2018-06-28 2020-01-02 联想(北京)有限公司 一种答案提供方法及设备
CN112700778A (zh) * 2019-10-22 2021-04-23 三星电子株式会社 语音识别方法和语音识别设备
CN114999533A (zh) * 2022-06-09 2022-09-02 平安科技(深圳)有限公司 基于情绪识别的智能问答方法、装置、设备及存储介质
CN117688145A (zh) * 2023-11-01 2024-03-12 青岛海尔特种电冰箱有限公司 用于问答交互的方法、装置和智能设备

Patent Citations (6)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
JP2000207214A (ja) * 1999-01-20 2000-07-28 Victor Co Of Japan Ltd 対話装置
JP2004251998A (ja) * 2003-02-18 2004-09-09 Yukihiro Ito 対話理解装置
WO2020000867A1 (zh) * 2018-06-28 2020-01-02 联想(北京)有限公司 一种答案提供方法及设备
CN112700778A (zh) * 2019-10-22 2021-04-23 三星电子株式会社 语音识别方法和语音识别设备
CN114999533A (zh) * 2022-06-09 2022-09-02 平安科技(深圳)有限公司 基于情绪识别的智能问答方法、装置、设备及存储介质
CN117688145A (zh) * 2023-11-01 2024-03-12 青岛海尔特种电冰箱有限公司 用于问答交互的方法、装置和智能设备

Cited By (3)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
CN119961426A (zh) * 2025-04-11 2025-05-09 四川省肿瘤医院 基于放疗流程的人工智能问答系统
CN119961426B (zh) * 2025-04-11 2025-07-04 四川省肿瘤医院 基于放疗流程的人工智能问答系统
CN120671848A (zh) * 2025-06-23 2025-09-19 北京字跳网络技术有限公司 与生成式语言模型交互的方法、装置、设备、介质和产品

Similar Documents

Publication Publication Date Title
US11792141B2 (en) Automated messaging reply-to
CN114503115A (zh) 生成丰富的动作项目
WO2020147428A1 (zh) 交互内容生成方法、装置、计算机设备及存储介质
CN115309877A (zh) 对话生成方法、对话模型训练方法及装置
CN106448670A (zh) 基于深度学习和强化学习的自动回复对话系统
CN110476169A (zh) 在会话中提供情感关怀
CN118098217A (zh) 人机交互方法、装置、电子设备及存储介质
CN118820436A (zh) 智能问答方法、装置、计算机设备和程序产品
CN112860995B (zh) 交互方法、装置、客户端、服务器以及存储介质
CN112581203A (zh) 在会话中提供解释性产品推荐
CN117573946A (zh) 对话样本生成方法、聊天对话大模型训练方法及相关装置
CN113868271B (zh) 智能客服的知识库更新方法、装置、电子设备及存储介质
CN111339745A (zh) 一种随访报告生成方法、设备、电子设备和存储介质
CN116975336A (zh) 基于人工智能的图像处理方法、装置、设备及存储介质
CN113569017A (zh) 一种模型处理方法、装置、电子设备及存储介质
CN120407717A (zh) 多轮对话问答方法、系统、电子设备和存储介质
CN117708307A (zh) 一种大语言模型微调和Adapter融合方法及装置
CN119557399B (zh) 应答数据的生成方法、装置及计算机程序产品
CN114090789A (zh) 基于知识图谱的中医养生智能多轮交互系统
CN119416748B (zh) 基于大模型的评论信息生成方法、装置、电子设备及存储介质
CN119149699A (zh) 通话方法及其装置
CN109002498B (zh) 人机对话方法、装置、设备及存储介质
CN117421399A (zh) 对话方法、装置、设备以及存储介质
CN118395227A (zh) 社交辅助方法、装置、电子设备及计算机可读存储介质
KR20240039904A (ko) 가상 공간에서의 심리 상담 방법 및 이를 위한 장치

Legal Events

Date Code Title Description
PB01 Publication
PB01 Publication
SE01 Entry into force of request for substantive examination
SE01 Entry into force of request for substantive examination