aboutsummaryrefslogblamecommitdiff
path: root/README.md
blob: 9917bf32f8172038f34f77a90dea8cae34934807 (plain) (tree)
1
2
3
4
5
6
7
8
9
10









                                                                                                      


                                                                                                                                                                                                                                           


               
                                                                                                                                                                                                                                                                                                                          


















                                                                                                                                                                                                                                   
# Стеммер Портера для русского языка

## Описание

Данный стеммер является заменой расширению stem_russian_unicode.

## Сравнение с расширением stem_russian_unicode

*Плюсы:*

1. Не требует внешних расширений для PHP. Стеммер написан целиком на PHP.
2. Нет проблем с юникодом. stem_russian_unicode зависит от SET_LOCALE и может при неверном значении портить строки с юникодом.
3. Легко изменять под конкретные требования проекта. В случае расширения, при изменении логики работы его придётся пересобирать.

*Минусы:*

1. В силу того, что этот стеммер написан на PHP с использованием регулярных выражений, он должен проигрывать в скорости работы скомпилированному расширению, написанному на C.
2. Требует для своей работы PHP версии >=5.4 (возможно, добавлю поддержку версии 5.3)

## Использование

    <?php
    $text = '...';
    require __DIR__ . '/vendor/autoload.php';
    $stemmer = new \NXP\Stemmer();
    $stemmed = [];
    foreach (explode(' ', $text) as $word) {
        $stemmed[] = $stemmer->getWordBase($word);
    }
    $result = implode(' ', $stemmed);

## Отличия от классического стеммера Портера

Единственное отличие заключается в том, что в данной реализации буква «ё» является самостоятельной гласной, а не буквой «е»

## Лицензия GPLv3