我的编程空间,编程开发者的网络收藏夹
学习永远不晚

pyhanlp拼音转换与字符正则化

短信预约 -IT技能 免费直播动态提醒
省份

北京

  • 北京
  • 上海
  • 天津
  • 重庆
  • 河北
  • 山东
  • 辽宁
  • 黑龙江
  • 吉林
  • 甘肃
  • 青海
  • 河南
  • 江苏
  • 湖北
  • 湖南
  • 江西
  • 浙江
  • 广东
  • 云南
  • 福建
  • 海南
  • 山西
  • 四川
  • 陕西
  • 贵州
  • 安徽
  • 广西
  • 内蒙
  • 西藏
  • 新疆
  • 宁夏
  • 兵团
手机号立即预约

请填写图片验证码后获取短信验证码

看不清楚,换张图片

免费获取短信验证码

pyhanlp拼音转换与字符正则化

本篇内容主要讲解“pyhanlp拼音转换与字符正则化”,感兴趣的朋友不妨来看看。本文介绍的方法操作简单快捷,实用性强。下面就让小编来带大家学习“pyhanlp拼音转换与字符正则化”吧!

《汉字转拼音与简繁转换的Java实现》

from pyhanlp import *

# 繁简转化

print(HanLP.convertToTraditionalChinese("“以后等你当上皇后,就能买草莓庆祝了”。发现一根白头发"))

print(HanLP.convertToSimplifiedChinese("憑藉筆記簿型電腦寫程式HanLP"))

# 简体转台湾繁体

print(HanLP.s2tw("hankcs在台湾写代码"))

# 台湾繁体转简体

print(HanLP.tw2s("hankcs在臺灣寫程式碼"))

# 简体转香港繁体

print(HanLP.s2hk("hankcs在香港写代码"))

# 香港繁体转简体

print(HanLP.hk2s("hankcs在香港寫代碼"))

# 香港繁体转台湾繁体

print(HanLP.hk2tw("hankcs在臺灣寫代碼"))

# 台湾繁体转香港繁体

print(HanLP.tw2hk("hankcs在香港寫程式碼"))

# 香港/台湾繁体和HanLP标准繁体的互转

print(HanLP.t2tw("hankcs在臺灣寫代碼"))

print(HanLP.t2hk("hankcs在臺灣寫代碼"))

print(HanLP.tw2t("hankcs在臺灣寫程式碼"))

print(HanLP.hk2t("hankcs在台灣寫代碼"))

「以後等你當上皇后,就能買草莓慶祝了」。發現一根白頭髮

凭借笔记本电脑写程序HanLP

hankcs在臺灣寫程式碼

hankcs在台湾写代码

hankcs在香港寫代碼

hankcs在香港写代码

hankcs在臺灣寫程式碼

hankcs在香港寫代碼

hankcs在臺灣寫程式碼

hankcs在台灣寫代碼

hankcs在臺灣寫代碼

hankcs在臺灣寫代碼

汉字转拼音

HanLP中的汉字转拼音功能也十分的强大。

说明

HanLP不仅支持基础的汉字转拼音,还支持声母、韵母、音调、音标和输入法首字母首声母功能。

HanLP能够识别多音字,也能给繁体中文注拼音。

最重要的是,HanLP采用的模式匹配升级到AhoCorasickDoubleArrayTrie,性能大幅提升,能够提供毫秒级的响应速度!

算法详解

《汉字转拼音与简繁转换的Java实现》

# 汉字转拼音

Pinyin = JClass("com.hankcs.hanlp.dictionary.py.Pinyin")

text = "重载不是重任!"

pinyin_list = HanLP.convertToPinyinList(text)

print("原文,", end=" ")

print(text)

print("拼音(数字音调),", end=" ")

print(pinyin_list)

print("拼音(符号音调),", end=" ")

for pinyin in pinyin_list:

    print("%s," % pinyin.getPinyinWithToneMark(), end=" ")

print("\n拼音(无音调),", end=" ")

for pinyin in pinyin_list:

    print("%s," % pinyin.getPinyinWithoutTone(), end=" ")

print("\n声调,", end=" ")

for pinyin in pinyin_list:

    print("%s," % pinyin.getTone(), end=" ")

print("\n声母,", end=" ")

for pinyin in pinyin_list:

    print("%s," % pinyin.getShengmu(), end=" ")

print("\n韵母,", end=" ")

for pinyin in pinyin_list:

    print("%s," % pinyin.getYunmu(), end=" ")

print("\n输入法头,", end=" ")

for pinyin in pinyin_list:

    print("%s," % pinyin.getHead(), end=" ")

print()

# 拼音转换可选保留无拼音的原字符

print(HanLP.convertToPinyinString("截至2012年,", " ", True))

print(HanLP.convertToPinyinString("截至2012年,", " ", False))

原文, 重载不是重任!

拼音(数字音调), [chong2, zai3, bu2, shi4, zhong4, ren4, none5]

拼音(符号音调), chóng, zǎi, bú, shì, zhòng, rèn, none, 

拼音(无音调), chong, zai, bu, shi, zhong, ren, none, 

声调, 2, 3, 2, 4, 4, 4, 5, 

声母, ch, z, b, sh, zh, r, none, 

韵母, ong, ai, u, i, ong, en, none, 

输入法头, ch, z, b, sh, zh, r, none, 

jie zhi none none none none nian none

jie zhi 2 0 1 2 nian ,

拼音转中文

HanLP中的数据结构和接口是灵活的,组合这些接口,可以自己创造新功能,我们可以使用AhoCorasickDoubleArrayTrie实现的最长分词器,需要用户调用setTrie()提供一个AhoCorasickDoubleArrayTrie

StringDictionary = JClass(

    "com.hankcs.hanlp.corpus.dictionary.StringDictionary")

CommonAhoCorasickDoubleArrayTrieSegment = JClass(

    "com.hankcs.hanlp.seg.Other.CommonAhoCorasickDoubleArrayTrieSegment")

Config = JClass("com.hankcs.hanlp.HanLP$Config")

TreeMap = JClass("java.util.TreeMap")

TreeSet = JClass("java.util.TreeSet")

dictionary = StringDictionary()

dictionary.load(Config.PinyinDictionaryPath)

entry = {}

m_map = TreeMap()

for entry in dictionary.entrySet():

    pinyins = entry.getValue().replace("[\\d,]", "")

    words = m_map.get(pinyins)

    if words is None:

        words = TreeSet()

        m_map.put(pinyins, words)

    words.add(entry.getKey())

words = TreeSet()

words.add("绿色")

words.add("滤色")

m_map.put("lvse", words)

segment = CommonAhoCorasickDoubleArrayTrieSegment(m_map)

print(segment.segment("renmenrenweiyalujiangbujianlvse"))

print(segment.segment("lvsehaihaodajiadongxidayinji"))

[renmenrenweiyalujiangbujian/null, lvse/[滤色, 绿色]]

[lvse/[滤色, 绿色], haihaodajiadongxidayinji/null]

字符正则化

演示正规化字符配置项的效果(繁体->简体,全角->半角,大写->小写)。

该配置项位于hanlp.properties中,通过Normalization=true来开启(现在直接通过HanLP.Config.Normalization开启即可)。

切换配置后必须删除CustomDictionary.txt.bin缓存,否则只影响动态插入的新词。

在我动笔前一个星期,已经有同学添加了,添加自定义词典之后,自动删除缓存的功能。地址请点击https://github.com/hankcs/HanLP/pull/954,现在只需要开启正则化即可

CustomDictionary =JClass("com.hankcs.hanlp.dictionary.CustomDictionary")

print("HanLP.Config.Normalization = False\n")

HanLP.Config.Normalization = False

CustomDictionary.insert("爱听4G", "nz 1000")

print(HanLP.segment("爱听4g"))

print(HanLP.segment("爱听4G"))

print(HanLP.segment("爱听4G"))

print(HanLP.segment("爱听4G"))

print(HanLP.segment("愛聽4G"))

print(HanLP.segment("喜欢4G"))

print(HanLP.segment("hankcs在臺灣寫代碼"))

print("\nHanLP.Config.Normalization = True\n")

HanLP.Config.Normalization = True

print(HanLP.segment("爱听4g"))

print(HanLP.segment("爱听4G"))

print(HanLP.segment("爱听4G"))

print(HanLP.segment("爱听4G"))

print(HanLP.segment("愛聽4G"))

print(HanLP.segment("喜欢4G"))

print(HanLP.segment("hankcs在臺灣寫代碼"))

HanLP.Config.ShowTermNature = False

text = HanLP.s2tw("现在的HanLP已经添加了添加自定义词典之后,自动删除缓存的功能,现在只需要开启正则化即可")

print(text)

print(HanLP.segment(text))

HanLP.Config.ShowTermNature = False

HanLP.Config.Normalization = False

[爱听4g]

[爱听4G]

[爱, 听, 4, G]

[爱, 听, 4, G]

[愛, 聽, 4, G]

[喜欢, 4, G]

[hankcs, 在, 臺, 灣寫, 代, 碼]

HanLP.Config.Normalization = True

[爱听4g]

[爱听4g]

[爱听4g]

[爱听4g]

[爱听4g]

[喜欢, 4, g]

[hankcs, 在, 台湾, 写, 代码]

現在的HanLP已經新增了新增自定義詞典之後,自動刪除快取的功能,現在只需要開啟正則化即可

[现在, 的, hanlp, 已经, 新增, 了, 新增, 自定义, 词典, 之后, ,, 自动, 删除, 快, 取, 的, 功能, ,, 现在, 只, 需要, 开启, 正, 则, 化, 即可]

到此,相信大家对“pyhanlp拼音转换与字符正则化”有了更深的了解,不妨来实际操作一番吧!这里是亿速云网站,更多相关内容可以进入相关频道进行查询,关注我们,继续学习!

免责声明:

① 本站未注明“稿件来源”的信息均来自网络整理。其文字、图片和音视频稿件的所属权归原作者所有。本站收集整理出于非商业性的教育和科研之目的,并不意味着本站赞同其观点或证实其内容的真实性。仅作为临时的测试数据,供内部测试之用。本站并未授权任何人以任何方式主动获取本站任何信息。

② 本站未注明“稿件来源”的临时测试数据将在测试完成后最终做删除处理。有问题或投稿请发送至: 邮箱/279061341@qq.com QQ/279061341

pyhanlp拼音转换与字符正则化

下载Word文档到电脑,方便收藏和打印~

下载Word文档

猜你喜欢

PHP正则表达式之如何分割字符串与转义字符串

这篇文章主要介绍“PHP正则表达式之如何分割字符串与转义字符串”,在日常操作中,相信很多人在PHP正则表达式之如何分割字符串与转义字符串问题上存在疑惑,小编查阅了各式资料,整理出简单好用的操作方法,希望对大家解答”PHP正则表达式之如何分割
2023-06-25

使用正则表达式将字符串的首字母由小写转换为大写

本篇文章给大家分享《使用正则表达式将字符串的首字母由小写转换为大写》,覆盖了Golang的常见基础知识,其实一个语言的全部知识点一篇文章是不可能说完的,但希望通过这些问题,让读者对自己的掌握程度有一定的认识(B 数),从而弥补自己的不足,更
使用正则表达式将字符串的首字母由小写转换为大写
2024-04-04

Pandas中字符串和时间转换与格式化的实现

本文主要介绍了Pandas中字符串和时间转换与格式化的实现,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一起学习学习吧
2023-01-17

编程热搜

目录