A categorização é a tarefa de rotular textos em linguagem natural de acordo com categorias pré-definidas [1]. Uma de suas aplicações mais tradicionais é a detecção de spam.
Na detecção de spam, pode-se categorizar os e-mails (textos) em duas classes (spam, não-spam).
Este repositório contém um exemplo de solução para o problema da detecção de spam por meio do uso de algoritmos de aprendizagem de máquina que, após serem apresentados a alguns exemplos previamente rotulados, são capazes de aprender e rotular automaticamente novos e-mails sem intervenção humana.
A base de dados utilizada é a disponibilizada pelo detector de spam open source SpamAssassin.
- Naive Bayes
- SVM Linear
- SVM RBF
- SEBASTIANI, Fabrizio. Machine learning in automated text categorization. ACM computing surveys (CSUR), v. 34, n. 1, p. 1-47, 2002.