Ubuntu怎么实现词频统计
这篇文章主要介绍了Ubuntu怎么实现词频统计的相关知识,内容详细易懂,操作简单快捷,具有一定借鉴价值,相信大家阅读完这篇Ubuntu怎么实现词频统计文章都会有所收获,下面我们一起来看看吧。
Ubuntu实现词频统计的示例:
使用shell实现简单的词频统计,例如:统计如下中第二列单词出现的次数。
1,huabingood,100
2,haha,200
3,huabingood,300
4,haha,100
5,haha,200
实现代码命令:
cat a.txt | awk -F "," '{print $2}' | sort | uniq -c | sort -nrk 1
代码解释:
awk -F "," '{print $2}' # 将数据按照逗号进行分割,并取出第二列的内容
sort # 将取出的内容进行排序。因为uniq统计时,如果重复的数据不连续,就会被认为时两个不同内容的行
uniq -c # 统计重复行出现的次数
sort -nrk 1 # 按照第一列重复的次数,按照数字顺序进行降序排列
关于“Ubuntu怎么实现词频统计”这篇文章的内容就介绍到这里,感谢各位的阅读!相信大家对“Ubuntu怎么实现词频统计”知识都有一定的了解,大家如果还想学习更多知识,欢迎关注编程网行业资讯频道。
免责声明:
① 本站未注明“稿件来源”的信息均来自网络整理。其文字、图片和音视频稿件的所属权归原作者所有。本站收集整理出于非商业性的教育和科研之目的,并不意味着本站赞同其观点或证实其内容的真实性。仅作为临时的测试数据,供内部测试之用。本站并未授权任何人以任何方式主动获取本站任何信息。
② 本站未注明“稿件来源”的临时测试数据将在测试完成后最终做删除处理。有问题或投稿请发送至: 邮箱/279061341@qq.com QQ/279061341