求推荐中小型项目敏感词检测 Python 案例
目前使用 re 去做,样本越来越大,效率逐渐降低很多
一般用字典树
如果是你负责,建议用 bat 的 API 。
Trie Tree
re + trie tree 因为要记录命中的敏感词,需要分组捕获。目前一个场景 build 出来的 pattern 大概有 300w 长,匹配一次感觉快要 1s ,用 bat 的 api 加上请求时间都比本地快好几倍。。。
是的,我是正则字典树去搞的,但是词库太大,有点担忧
也有在用,本地做第一层拦截
hyperscan
1.目前主流的做法是,先分词,然后再去匹配敏感词列表。优点是性能高,速度快。缺点是匹配覆盖率低。
2.但如果要保证匹配覆盖率,运算量必然超大,因为不能分词后再去匹配,而是反过来要用词库来匹配现有内容。可优化的就只有在匹配过程中对字典树进行剪枝了。
zhuanlan.zhihu.com/p/146369212
AC 自动机?
我之前写了个 AC 自动机用来匹配和过滤关键词,现在生产环境大概有 1 亿个关键词,性能非常好。
不过只有 Go 和 Java 版本,看看能不能帮到你,代码实现很简单,照着直接“翻译”成 Python 应该没啥问题。
Go: github.com/yihleego/trie
Java: github.com/yihleego/trie4j
感谢感谢,我去看看
在意性能可以用布隆过滤器
这个感觉有点子臃肿,好多依赖🤣
分词这个方向目前还没考虑到,居家办公比较闲,研究研究
测试过 ahocorasick 这个库,感觉差不是太多
不用研究,Python 有现成的,叫 结巴分词。
这应该就是 AC 状态自动机干的事吧
楼主可以看看这个 github.com/G-Research/ahocorasick_rs
flashtext
github.com/intel/hyperscan
www.colm.net/open-source/ragel/
好像是 v2 以前有个帖子,当时特别震撼
这个帖子 www.hesudu.com/t/828016
这个就是性能最好的,比什么 AC 字典树都快,安全防火墙都用这个代替以前 AC 了
🙏我去研究下这个
o..o
都推 hyperscan ,我去测试下😂
哎, 作孽啊
下面是一些关于C++构造函数的FAQ。你能回答得出来吗?你可以点链接查看答案,不过是英文版的。他们来自于C++ FAQ Lite。当然,也有中文版的,只可惜中文版的太老了,只更…
朋友有创业计划,刚好我工作的业余比较闲,就打算帮一把。 当前我的问题我是一个 C++纯后端开发人员,过往的经历也很少做 web ,主要是围着交易所和交易系统打交道的。 如果我想…
分红包,上限是总奖金 30%,下线 1 元,输入奖金总数 m 和人数 n ,输出一个列表表示每个人红包 思路一 传统分红包办法,1 到 n-1 人领随机生成 range ( 1…
合速度