一、知识图谱基本概念
知识图谱定义是一种知识表示形式。对概念及其关系进行完整描述。在互联网时代,知识图谱是一种大规模语义网络,包括实体、概念及其之间的各种语义关系。如下图,柏拉图就是一个实体,他是一个哲学家(概念)。通过柏拉图知识图谱,我们可以了解柏拉图的全部属性和关系。

知识图谱是典型的大数据时代产物,随着互联网信息的爆炸式增长,依托互联网的大规模、多元化、海量数据,获取概念的实际关系,进一步加深对概念和事物的认识,获取更加系统和深入的知识,进而深入了解用户,更好为用户服务。因而受到各大互联网公司青睐,并在不知不觉中被广泛应用于搜索、电商、社交等各个领域。知识图谱核心价值在于如何沉淀知识。图谱开始建立的时候,都是关系图谱,通过大量的模型,借助于图谱模型的高度解释性的优势,构建和形成很多隐性关系和实体标签,最后建设成为知识图谱。在关系图谱到知识图谱的建设过程中,业务专家高度参与,利用知识图谱的探索式数据分析能力,自助构建高度解释性的业务知识模型,形成知识沉淀的迭代和高度分享。
2017年,我国科学目录调整时,首次出现了知识图谱学科,教育部对知识图谱这一学科的定位是“大规模知识工程”。而知识工程又是人工智能的重要组成部分。
二、知识图谱发展现状
知识图谱早期主要用于搜索结果优化,随着电商、互联网金融等兴起,应用领域不断增加,包括智能推荐、智能客服、金融风控、安全与安防等都在积极探索。
(1)搜索优化
知识图谱的诞生最早可以追溯到2010年前后,主要是为了解决搜索引擎用户体验问题。搜索领域主要面临两方面问题:一方面,搜索需求和搜索结果往往难以匹配,经常有“搜”非所问的情况;另一方面,搜索结果编排无序,显示杂乱。
2010年,微软开始构建MicrosoftSatori知识图谱来增强Bing搜索能力;2012年5月,Google公司为了支撑其语义搜索推出KnowledgeGraph,目前已成为全球最大的知识图谱。2012年11月22日,搜狗知立方上线,成为国内首个搜索引擎“中文知识图谱”。差不多同一时间,百度知识图谱被立项。2013 年,Facebook发布OpenGraph应用于社交网络智能搜索。
早期各大搜索平台主要依赖“关键字搜索”技术,返回给用户包含关键字的网页列表,用户需要进一步浏览这些网页并且过滤掉大量无用信息才能找到真正想要的结果,用户更希望能够“直接得到答案”。利用知识图谱技术可以直接给出用户想要的搜索结果,而不再是各类链接。如下图,搜索“上海有多少人?”360搜索直接展示出国家统计局的数据,用户直接将鼠标移动到相应年份,可以快速查看各年数据。
随后,知识图谱引入到电商搜索领域。2015年,阿里巴巴开始构建电商领域知识图谱——认知图谱;2016年Amazon也紧随其后开始构建知识图谱。2018年5月,美团点评NLP中心开始构建大规模的餐饮娱乐知识图谱——美团大脑。
在搜索领域,知识图谱能够将用户所提交的查询词理解成实体或者概念,通过实体或者概念匹配为用户返回其可能关心的全部网页内容。搜索引擎中知识图谱的搜索过程如下:

知识图谱用文本和知识融合的阅读理解模型,使搜索结果更理解客户需求。
对于电商平台来说,交易量和客户活跃度也是其核心竞争力,而客户一般都是通过搜索获得想要的商品,越精准的搜索结果,客户使用越多。因此,百度、搜狗、阿里巴巴、美团、腾讯等不断摸索,纷纷尝试构建自己的知识图谱平台。

命名实体识别(Named Entity Recognition,NER)是自然语言处理(NLP)的基础任务,目标是从文本中识别并分类特定类型的实体,如人名、地名、组织名、产品名、数值等。在电商场景中,需扩展识别商品特有实体类型,如品牌、型号、规格参数等。
以知识图谱进行链接匹配的方式:
通过信息抽取之后从数据源中得到实体、关系、属性、属性值等电商信息。需要将这些多源异构、信息多样、动态演化的电商信息通过冲突检测和一致性检测,对电商信息进行正确性判断,去粗取精,提升质量。
智能匹配主要包括两部分操作:实体链接与知识合并。
实体链接(entity linking)是对将通过以上方法得到的实体通过相似度计算链接到知识库中实体操作。
在实体链接中需要进行实体消歧与共指消解;主要是为了判断知识库中的同名实体存在不同的含义,与不同命名实体具有相同含义。 实体消歧用于同名实体存在不同的含义,实体消歧结合当前语境,准确建立实体链接。实体消歧可采用聚类与基于上下文的词性消歧和词义消歧。
共指消解(对象对齐、实体匹配、实体同义)用于不同命名实体具有相同含义,采用共指消解将共同指向的实体关联或合并。
自动构建过程主要包含三个阶段:实体并列关系相似度计算、实体上下位关系抽取与本体的生成。
1、实体并列关系相似度计算主要用来计算任意两个给定的实体在指标测度、相似度上属于同 一概念分类的程度。如联想和戴尔在作为商品的实体,具有较高的并列关系相似度;而联想与海尔这两个实体属于同一语义类别的可能性较低,因此具有较低的并列关系相似度。常用来进行实体并列关系相似度的计算方法有模式匹配法和分布相似度。
2、实体上下位关系抽取用来确定概念之间的从属关系或者说是上下位关系。如词组(ThinkPad,笔记本)构成上下位关系,ThinkPad为下为词,笔记本为上位词。现关于实体上下位关系抽取的主要方式有:
a、基于语法模式抽取上下位关系实体对;
b、基于概率模型判定或区分上下位关系,经 常借助百科类网站提供的概念分类知识来帮助训练模型,来提高算法精度;
c、用跨语言的知识链接方法构建本体库。
3、本体的生成是对各层次得到的概念进行聚类,并对其进行语义类的标定,为该类中的实体指定一个或多个公共上位词。
(2)智能推荐
除了优化搜索结果,知识图谱还可以帮助电商以及社交平台解决一些智能推荐问题。例如,当前一些中小平台在智能推荐方面最大的问题是“买了啥,推荐啥”或者“推荐的商品与客户无关联”。推荐商品缺乏新颖性,导致转化效果一般。知识图谱可以帮助电商平台跳出这种简单的推荐逻辑,使得推荐结果更加智能化,促进用户购买。
(3)金融风控
近些年,消费金融和小微企业贷兴起后,银行以及其他持牌金融公司、助贷机构、人工智能公司等开始将知识图谱应用于风险控制,特别是识别团伙欺诈。
知识图谱的推理能力和可解释性,在金融场景中具有天然的优势。艾瑞咨询年初发布的《2020年中国面向人工智能“新基建”的知识图谱行业研究报告》指出,随着近些年金融数据的爆发式增长,传统风控系统逐渐力有不逮,而应用机器学习算法和知识图谱的智能风控系统在风险识别能力和大规模运算方面具有突出优势,逐渐成为金融领域风控反欺诈的主要手段。在金融领域,知识图谱可以应用于小微企业信贷、消费信贷、信用卡申请等反欺诈业务,还可以用来识别会计造假。
基本原理简单理解是:“物以类聚,人以群分。”如“同一个WiFi下多个企业借款客户”,或者“同一个设备注册多个企业账号申请借款”,均有可能与欺诈相关 。因此,信贷欺诈的识别问题可以转化为客户知识图谱挖掘或社交网络分析问题。即把企业工商信息、新闻动态、股东关系、股权变更、司法诉讼等等整合到反欺诈知识图谱里,经过分析和预测,挖掘识别欺诈案件,如利用壳公司贷款等。
再从常见的担保业务来看,担保网络可简化为规模较小、相对独立的担保群。担保群间担保关联稀疏;担保群内部联系紧密,担保圈风险一般只发生在群内部,找到风险最大的担保群,然后就可以找到风险最大的担保企业。
公安机关在侦查案件时,经常看到办案民警用图谱梳理案件及人物关系。在电视剧《人民的名义》中,警方利用知识图谱分析,可以很快看清“山水集团”背后的利益链条。
知识图谱从大数据中深度挖掘关联关系,可准实时分析多至千亿级海量关系数据,转化为关系图谱数据,支撑公安机关展开情报研判分析、犯罪团伙跟踪以及重大事情预警等。
三、知识图谱在网上商城中的应用
(1)商品和服务寻源
随着数字时代的到来和各行业蓬勃发展,各类供应商数量呈现井喷式增长。在采购单位实施采购行为或信息化系统建设时,如何从浩如烟海的候选者中选择能力匹配、质量上乘、资质过硬、经验丰富的供应商成为了困扰采购部门的难题。针对采购过程中的决策难题催生了网上商城对寻源工具和服务:针对已确定内容的采购项目寻找匹配精准的商品供应商名单,大大减少采购人员负担,保障采购过程的顺利进行。
寻源工具产品是通过海量标讯积累建立采购行业信息检索引擎,以知识图谱为底层技术,建立结构化的业主-供应商-案例-商品网络,实现四种实体的关联呈现。采购知识云的使用方法与其他引擎无异,在检索框输入检索对象(业主、供应商、案例、商品关键词),搜索结果自动识别主体类别,并以案例为关联关系,梳理展示相关的联想知识,真正做到让客户“搜一看二得三”。
依据深根采购行业多年的知识积累亿级采购相关数据并建立案例信息库、供应商库和业主库,对公开网络的招标、中标信息、官方网站信息及软文进行按日进行持续采集和更新(日更新数据可达到十万级别)。采集到的案例信息将作为建成案例分析、相关供应商、项目价格参考的基础,每日更新的案例信息为获取最新、最全的行业动向提供支撑。通过对信息进行结构化拆解,并利用知识图谱技术形成业主、供应商、案例、商品四种实体间的底层知识网络,实现从一种实体联想到全量关联信息的功能。除了通过标讯识别商品和供应商外,还会利用公开官网信息、合作供应商上报等方式完善供应商库,丰满供应商能力、完善供应商案例库,确保数据的准确性、时效性,提升需求匹配精度。
(2)价格监测
当今社会,人们越来越习惯于网络购物带来的便利。在互联网电子商务模式下,网上商城充分发挥“高效率、低成本、透明化”的优势,解决了小额高频的采购场景。与社会化的电子商务交易不同,企业在采购的项目规格、交易流程、商品管理、价格控制等方面有着严格的规定,这给企业网上商城的建设和运营带来了巨大的挑战和压力。
根据政府采购监管规定,上架销售商品必须严格遵循商品信息标准,价格合理,符合限购要求,符合资产管理要求,非特价特供商品,符合新产品上架条件等相关管理规定的,经审核后方可上架。《政府采购法》要求政府采购商品的价格应当低于市场平均价格,这就要求商店建立科学合理的商品平均价格计算模型,准确计算包括社会电子商务、其他政府采购的门店和厂家价格等在内的商品的市场平均价格,并建立商品的合理价格区间。同时,对各门店上架商品进行全面价格监测,并逐一与计算出的合理价格进行比对,超出合理价格范围强行下架。
价格监测服务是指应用现代互联网技术、云计算技术和人工智能技术,充分利用大数据数据量大、处理速度快的特点,利用人工智能技术实现信息商品的自动识别。同时,通过人工审核和机器学习,对产品进行集中管理,使相同参数的产品同质化,建立一套价格参考体系。
基于大数据平台上的数千万商品数据,利用现代数理统计模型和计算方式,可以将企业采购商品的价格与全国各个电商平台及政府采购平台商品进行比较。一方面,我们可以系统地判断商品的价格。无论是在合理范围内还是超出范围内,都可以提前预警或直接下架,从而实时监控商品价格;另一方面,还可作为对在售产品进行监控和人工审核的依据。
价格监测除了提供实时的价格监测和预警外,还可以提供商品历史价格曲线和价格监测报告,作为判断供应商提供的商品和服务质量以及合同履行情况的依据,对供应商的违规行为有较好的威慑作用。
通过建立标准商品库,监测平台实时对多个政府采购电子卖场和大型电商、厂商的商品价格,定期更新,对提交上架商品审核和已经上架商品定期扫描更新下架,实现对网上商城商品价格的实时监测,对供应商商品价格进行常态化监管;同时,定期抽查部分商品形成价格监测报告,发现高价格的商品和供应商,并与大型电商的商品价格进行比较,为采购监管提供科学决策依据。
(3)比价比选
网上商城在为采购人提供更多的商品选择的同时,也在一定程度上增加了采购人快速挑选出满意商品的困难性。供应商提供的商品种类繁多,上架商品数量庞大,可能存在大量相同或相似的商品,不仅价格各异,同时也包含了大量无用信息,极大增加了采购人挑选商品的难度。在海量的商品中,为了买到有服务保障且物美价廉的商品,采购人往往需要投入大量的时间去对各个供应商的商品做比较,浪费很多时间和精力,这与网上商城购物的便捷性背道而驰。
比选比价是指将采购者指定的商品在众多电商平台上的商品信息和价格进行对比,采购人通过比选比价能够方便地发现某一商品在各电商平台中的规格参数以及价格差异,简化用户购买商品中的搜索对比过程。通过网络信息采集,结合协同过滤推荐算法,在比价的同时增加商品推荐系统,实现个性化推荐的主动展示模式的转变。
使用网络信息采集技术从各个电商平台获得海量数据,为用户提供跨平台的商品比价功能,通过对用户的浏览喜好和商品数据预处理,为用户提供商品推荐功能。通过比价和推荐功能的实现,让采购人拥有更加便捷、智能的购物体验,满足用户对物美价廉商品的探索需求。
商品推荐分为常规推荐、个性化推荐。常规推荐是指商家选择一些固定商品放在推荐位,或者基于商品之间的关联性,进行相关的商品推荐。
采购人直接在商品销售网页中获取推荐商品和价格信息,采购人可以通过比价服务清晰地发现商品这些,观察价格差异,从而寻找到“最优商品”,避免在采购过程中受到厂家与经销商的制约出现价格虚高、特供型号无法比价、价格与市场不同步、缺乏监督等重点问题,确保采购过程公平公正、有效节约资金。
个性化推荐系统将无关的商品信息去除,依据采购人的关注点、购买记录、爱好等信息,将采购人感兴趣的商品推送给用户,这样做的意义,一方面可以提高供应商的销量,另一方面在于保留用户的兴趣爱好和习惯,可以提高用户使用体验,鉴于此比选比价服务具有现实意义,能够有效的维持用户采购习惯,增加用户粘性。
利用信息采集技术,可以从多个电子商务平台上获取整合产品信息。在企业网上商城平台中,将目标产品的价格及相关信息展示给用户,为用户决定购买行为提供信息支持,便于购买者做出正确的决定。
为用户提供跨平台的产品搜索功能。用户可以在本网站上搜索任何产品,从不同的电商平台获取产品信息,了解一段时间内的价格波动趋势、产品评论等信息。用户有不同的搜索记录、浏览偏好和产品评价记录,这些记录与产品自身信息集成,可以实现用户个性化分析结果,并为不同用户提供最合适的建议。
为了提高商城内部商品销售的有效转化率,增加商品销量。通过用户已经浏览、收藏、购买的记录,更精准的理解用户需求,对用户进行聚类、打标签,推荐用户感兴趣的商品,帮助用户快速找到需要的商品,适时放大需求,售卖更加多样化的商品,甚至做个性化营销。


网友留言2