Porter Stemming for Russian language
Find a file
Alexander Kiryukhin 2cc39b05b8
Merge pull request #10 from vklimin/patch-3
Update Stemmer.php
2018-01-14 00:26:24 +03:00
src/NXP Update Stemmer.php 2018-01-11 19:34:51 +05:00
tests All methods are now static 2017-11-07 15:12:47 +07:00
.gitignore first commit 2013-11-27 04:06:49 +04:00
composer.json All methods are now static 2017-11-07 15:12:47 +07:00
LICENSE Create LICENSE 2016-11-25 17:38:50 +03:00
phpunit.xml.dist Issue 1, Issue 2, Issue 3, Issue 4 2014-11-13 15:53:59 +03:00
README.md Update README.md 2017-04-14 00:25:59 +03:00

Стеммер Портера для русского языка

Описание

Данный стеммер является заменой расширению stem_russian_unicode.

Сравнение с расширением stem_russian_unicode

Плюсы:

  1. Не требует внешних расширений для PHP. Стеммер написан целиком на PHP.
  2. Нет проблем с юникодом. stem_russian_unicode зависит от SET_LOCALE и может при неверном значении портить строки с юникодом.
  3. Легко изменять под конкретные требования проекта. В случае расширения, при изменении логики работы его придётся пересобирать.
  4. Требует для своей работы PHP версии >=5.3 (спасибо, usernam3 за pull-request)

Минусы:

В силу того, что этот стеммер написан на PHP с использованием регулярных выражений, он должен проигрывать в скорости работы скомпилированному расширению, написанному на C.

Установка

php composer.phar require nxp/russian-porter-stemmer

Использование

<?php
$text = '...';
require __DIR__ . '/vendor/autoload.php';
$stemmer = new \NXP\Stemmer();
$stemmed = [];
foreach (explode(' ', $text) as $word) {
    $stemmed[] = $stemmer->getWordBase($word);
}
$result = implode(' ', $stemmed);

Отличия от классического стеммера Портера

Единственное отличие заключается в том, что в данной реализации буква «ё» является самостоятельной гласной, а не буквой «е»

Лицензия MIT