[00262506]一种基于无词典的中文地址分词方法
交易价格:
面议
所属行业:
分析仪器
类型:
发明专利
技术成熟度:
正在研发
专利所属地:中国
专利号:CN201710441735.1
交易方式:
技术转让
技术转让
技术入股
联系人:
武汉工程大学
进入空间
所在地:湖北武汉市
- 服务承诺
- 产权明晰
-
资料保密
对所交付的所有资料进行保密
- 如实描述
技术详细介绍
摘要:本发明公开了一种基于无词典的中文地址分词方法,包括以下步骤1)通过统计得到训练语料中任意长度大于1小于等于8的字符串的词频,互信息,信息熵;2)通过正则表达式对地址字符串进行预处理;对输入地址字符串进行全切分;3)根据互信息和信息熵算法得到弧段花费最小的分词方案;4)根据置信度方法对该分词方案的字符串集合进行二次计算,判断该字符串是否为真实词条,得到最优的分词方案。
摘要:本发明公开了一种基于无词典的中文地址分词方法,包括以下步骤1)通过统计得到训练语料中任意长度大于1小于等于8的字符串的词频,互信息,信息熵;2)通过正则表达式对地址字符串进行预处理;对输入地址字符串进行全切分;3)根据互信息和信息熵算法得到弧段花费最小的分词方案;4)根据置信度方法对该分词方案的字符串集合进行二次计算,判断该字符串是否为真实词条,得到最优的分词方案。