10. Как можно применять обнаруженный авторский инвариант Возможное обнаружение плагиата
10. Как можно применять обнаруженный авторский инвариант
Возможное обнаружение плагиата
Одно из возможных применений обнаруженного авторского инварианта — это распознавание плагиата, установление возможного авторства и т. п. Можно предложить следующую естественную методику. Если для двух исследуемых произведений значения параметра 3 (процент служебных слов) разнятся больше, чем на единицу, то есть основания заподозрить различное авторство сравниваемых текстов. Чем больше разница в значениях инварианта, тем подозрение серьезнее.
С другой стороны (как и в проблеме установления отцовства) близкие значения инварианта отнюдь не означают, что исследуемые произведения написаны одним автором. Как мы отмечали, встречаются разные писатели с близкими значениями инварианта. Например, Леонов и Фадеев, у которых эти числа равны соответственно 23,08 и 23,40.
Кроме того, применять методику распознавания авторов к текстам МАЛОГО объема следует чрезвычайно осторожно. Возникающие здесь трудности можно проиллюстрировать на примере крупных и мелких произведений А.П. Чехова. Параметр 3 (процент служебных слов) был просчитан вдоль всех его произведений в собрании сочинений, изданном в 1960–1964 гг., Москва. Оказалось, что параметр 3 ведет себя следующим образом:
Разница между значениями параметра 3 для ранних МЕЛКИХ рассказов Чехова (I–V тома) и для более КРУПНЫХ повестей и рассказов позднего периода его творчества (VI–VIII тома) — достаточно ощутима, рис. d3.8. Причем в ранних МЕЛКИХ рассказах не только МЕНЬШЕ служебных слов, но главное заключается в том, что разброс их больше, чем в последующих КРУПНЫХ произведениях. БОЛЬШИЕ (поздние) тексты Чехова характеризуются ВЫСОКОЙ СТАБИЛЬНОСТЬЮ авторского инварианта, как впрочем, и для всех других 26 авторов БОЛЬШИХ текстов из нашего списка. В этом смысле Чехов не выделяется на их фоне — параметр 3 прекрасно «обслуживает» все его БОЛЬШИЕ сочинения.
Рис. d3.8. Процент служебных слов может «давать сбои» на текстах малого объема. Это видно на примере произведений А.П. Чехова
В заключение отметим еще одно интересное обстоятельство. Оказалось, что процент служебных слов наиболее стабилен (при величине порций в 8000 и 16 000 слов) на ПРОЗАИЧЕСКИХ произведениях и менее устойчив на ПОЭТИЧЕСКИХ текстах. Этот вопрос заслуживает отдельного рассмотрения и здесь мы не будем на нем останавливаться.
Обнаружение авторского инварианта в русском литературном языке делает весьма правдоподобной гипотезу о существовании аналогичных авторских инвариантов и в других языках. Они могут, конечно, отличаться от процента служебных слов. Особый интерес представляли бы авторские инварианты греческого и латыни, если иметь в виду применение аналогичных методик для распознавания авторства древних текстов.
Данный текст является ознакомительным фрагментом.