Baranov, Victor
Kalashnikov Izhevsk State Technical University, Russian Federation
victor.a.baranov@istu.ru
Исторический корпус “Манускрипт: славянское письменное наследие” (manuscripts.ru) содержит машиночитаемые транскрипции более 140 полных кодексов и дошедших до настоящего времени отрывков средневековых письменных памятников X–XV веков общим объемом около 3,5 млн текстовых форм.
Технологической платформой корпуса является полнотекстовая база данных, модель которой предусматривает хранение любых структурных единиц рукописей, текстов, словарей, их характеристик и связей между ними.
Пользовательский интерфейс включает запросные веб-формы и интерфейсы визуализации выборок, которые, наряду со стандартными для корпусов параметрами запросов и режимами демонстрации (формирование подкорпуса, поиск по маске, поиск словосочетаний, вывод конкорданса и др.), имеют и нестандартные, позволяющие сформировать подкорпуса на основе аналитической разметки, вывести на экран любую часть рукописи по диапазону листов, просмотреть указатели лингвистических единиц или в максимально приближенной к оригиналу форме, или с максимальной ее унификацией, построить сопоставительные перечни нескольких кодексов и др. (Баранов 2015; Baranov 2018; Баранов 2019а).
Известно, что количественные и статистические методы давно и очень успешно используются для решения большого количества прикладных и теоретических задач, в том числе в области лингвистики, филологии и истории (см., например, (Морозов 1915; Марусенко 1990; Милов и др. 1994; Шайкевич и др. 2013; Захаров / Хохлова 2014; Митрофанова 2015; Литвинова и др. 2016; Mimno / Blei 2011; Bing 2012; Blei 2012; Daud 2012; Guest et al. 2012; Jurafsky / Martin 2020: 325–415) и многие другие работы, посвященные общим и частным вопросам на стыке статистики и гуманитарных наук).
Наличие достаточно большой коллекции структурированных и размеченных текстов позволило поставить вопрос о разработке программ, процедур и веб-интерфейсов поиска и демонстрации сведений о количественных и статистических характеристиках лингвистических единиц. Такими специализированными модулями корпуса в настоящее время являются модуль статистики и модуль n-грамм. Первый позволяет увидеть распределение слов внутри рукописей, сопоставить количественные характеристики единиц текстов, оценить их с помощью статистических мер в сопоставлении с контрольным подкорпусом. Второй – построить перечни n-грамм отдельной рукописи или подкорпуса на основе статистических, формально-структурных и/или лингвистических параметров (Баранов 2016; Baranov / Gnutikov 2019).
В докладе будут представлены результаты количественного и статистического анализа четырех славянских списков XI–XIII веков служебной минеи на май (РНБ, Соф. 202; РНБ, Соф. 203; РНБ, Соф. 204; ГИМ, Син. 166). Внимание будет уделено трем этапам работы: а) приемам построения подкорпусов на основе разметки больших и малых чтений (канонов, стихир и седальнов), б) предоставляемым статистическими модулями способам и параметрам извлечения и сопоставления данных, в) использованию подготовленных выборок в специализированных статистических пакетах. Кроме того, будут даны примеры лингвотекстологической интерпретации результатов количественной и статистической оценки текстов компилятивного состава, текстовые и языковые особенности которых должны исследоваться с учетом их состава и структуры.
Необходимость такого подхода диктуется сложной историей формирования структуры и состава служебных (повседневных) миней в греческой и славянской традициях (Нечунаева 2000; Кривко 2008; Йовчева 2014; Кривко 2016; Пентковский 2018), наличием нескольких историко-типологических групп миней, по терминологии Р. Н. Кривко (Кривко 2016: 15–16), отдельным существованием больших и малых чтений в составе особых книг как в палестинской гимнографической традиции (Кривко 2008: 90–92; Кривко 2016: 13), так и в славянской (Пентковский 2018: 258–259, 267), наличием в древнейших минеях разных редакций (переводов) одних и тех же последовательностей (Кривко 2016) и отдельных их жанров, например стихир (Пентковский 2018: 252, 267–269), которые могли делатьсяя в том числе и на основе различных исходных греческих текстов (Пентковский 2018: 267, 271) и др. Анализ текстологических, лексических, словообразовательных, морфологических разночтений позволяет систематизировать сохранившиеся списки, установить их преемственность, сделать выводы о характере влияния древнейших переводов и редакций на более поздние и т. д. (см., например, (Нечунаева 2000; Кривко 2015) и мн. др. работы).
Методика анализа разночтений предполагает сопоставление или отдельных лексем, словообразовательных или морфологических форм, или ряда разночтений разного типа в относительно небольшом по объему, содержащем один и тот же текст фрагменте нескольких списков.
Наличие полнотекстового размеченного корпуса средневековых славянских миней и компьютерного инструментария работы с ними позволяет поставить задачу выявления имеющихся в рукописях значимых лингвистических различий, которые могут быть обнаружены в результате количественного и статистического анализа тех или иных текстовых форм в полном объеме в ходе а) сопоставления рукописей друг с другом, б) сопоставления текстов разных жанров друг другу в пределах одного списка, в) сопоставления текстов одного жанра в разных рукописях с текстами другого жанра в тех же списках. Решение первой задачи представлено в работах (Баранов 2018; Баранов 2019б; Баранов 2019в), методика решения второй и третьей задач будет представлена в данном докладе.
Формирование подкорпусов. Аналитическая разметка на основе характеристик фрагментов миней позволяет сформировать подкорпуса канонов, стихир и седальнов как одной рукописи, так и нескольких, с помощью специализированных модулей извлечь из них ключевые слова или би- и триграммы и с помощью сопоставления их состава сделать выводы о лексико-тематических и лексико-семантических характеристиках.
Ключевые слова. Извлечение статистически значимых (ключевых) слов осуществляется в модуле статистики с помощью статистических мер Log-Likelihood, TF*ICTF, Weirdness (об этих мерах см., например, (Kwok 1995; Ahmad at al. 1999; Rayson / Garside 2000: 3; Roelleke / Wang 2006; Wu et al. 2008: 17; Ляшевская / Шаров 2011: 8–9; Клышинский / Кочеткова 2014: 368)) на основе сравнения частотности лингвистических единиц в анализируемых подкорпусах с их частотностью в контрольном подкорпусе, в качестве которого может быть выбран, например, подкорпус, включающий или только минеи, или все тексты исторического корпуса.
Статистически значимые сочетания. Модуль n-грамм обеспечивает извлечение из подкорпусов таких сочетаний текстовых форм (или лемм), которые претендуют на статус устойчивых. Помимо оценки дистрибуции с помощью статистических мер (Mutual Information и ее варианты, T-score, Log-Likelihood, Dice, Chi-squared, Log Ratio, Minimum Sensitivity, Inside, C-value) (об этих мерах см., например, (Evert 2010; Mima et al. 1998; Браславский / Соколов 2006; Ягунова / Пивоварова 2013; Кочеткова 2013)), модуль статистики предоставляет пользователям возможность указать расстояние между компонентами, учесть границы конструкций, разделенных пунктуационными знаками, порядок следования компонентов – закрепленный или свободный и другие характеристики сочетаний.
Унификация маски. При подготовке запросов пользователь может устранить графическую вариативность слов и форм и получить сведения не о их текстовых вариантах, а о собственно лингвистических единицах – словоформах и леммах. Вариативность снимается унификацией диакритики и титл и/или их устранением, заменой вариантных букв на основные, выполнением запроса на основе лемм, транслитерацией.
Эксперименты с текстовыми формами, леммами и их сочетаниями, извлеченными из подкорпусов канонов, стихир и седальнов, позволяют установить тематическую специфику малых и больших чтений.
Корреляционный и кластерный анализ. Извлеченные из подкорпусов соответствующие друг другу по характеристикам перечни могут быть проанализированы в специализированных статистических пакетах. В работе использован пакет Statistica (TIBCO Software Inc.), с помощью которого на основе ранговой статистики Спирмена исследуется степень корреляции подкорпусов друг другу (о методе см., например, (Фёрстер / Рёнц 1983: 160–163)) и анализируется степень их статистической близости с помощью кластерного анализа (см., например, (Tryon 1939; Cattell 1944; Sokal / Sneath 1963; Мандель 1988; Прикладная статистика 1989; Gore 2000; Маннинг и др. 2011: 383–396)).
С целью нивелирования влияния на результаты анализа тематики сопоставляемых подкорпусов в качестве материала выбраны служебные слова (предлоги, союзы, частицы), характеризующиеся тематической нейтральностью. Корреляция для каждой пары подкорпусов вычисляется на основе сведений о месте (рангах) соответствующих друг другу служебных слов в сортированных по их частотности перечнях. Набор значений попарных корреляций каждого из подкорпусов принимается за индивидуальную характеристику подкорпуса и используется на следующем этапе – при одномерном кластерном анализе.
Для подтверждения объективности результатов применяются различные сочетания приемов формирования кластеров (одиночной связи, полной связи, метода Варда и др.) и вычисления близости (Евклидово расстояние, Манхэттенское расстояние и др.). Эксперименты позволяют установить степень близости подкорпусов канонов, подкорпусов стихир и подкорпусов седальнов нескольких текстов друг другу.
Эффективность и результативность использования больших хранилищ машиночитаемых размеченных средневековых текстов для лингвистического анализа во многом зависит от наличия специализированных инструментов доступа к данным и режимов демонстрации выборок. При этом специфические особенности точных транскрипций требуют соответствующих инструментов обработки, унификации, нормализации, разметки, извлечения и визуализации данных. В свою очередь специализированный инструментарий позволяет лингвисту-историку использовать новые приемы систематизации и сравнения данных, работать с полным массивом лингвистических единиц, ставить и решать задачи количественной и статистической оценки текстовых и языковых единиц сопоставляемых массивов (подкорпусов) данных.
Результативность такого взаимовлияния средневекового текстового материала, инструментария и статистических методик демонстрируется в докладе.
Работа выполняется при поддержке Российского фонда фундаментальных исследований (РФФИ) в рамках проекта “Лингвостатистический анализ однокомпонентных и многокомпонентных лексических единиц исторического корпуса “Манускрипт”” (грант № 18-012-00463).
Модуль статистики корпуса “Манускрипт” <http://manuscripts.ru/mns/!cred2.stat>
Модуль n-грамм корпуса “Манускрипт” <http://manuscripts.ru/mns/cred_ngr.stat>
Служебная минея на май (Путятина Минея), XI в. (РНБ, Соф. 202), 135 л. <http://manuscripts.ru/mns/main?p_text=16723192>
Служебная минея на май, XII в. (РНБ, Соф. 203), 136 л. http://manuscripts.ru/mns/main?p_text=27457098.
Служебная минея на май, XII в. (ГИМ, Син. 166), 176 л. <http://manuscripts.ru/mns/main?p_text=26361893>
Служебная минея на май, XIII в. (РНБ, Соф. 204), 133 л. <http://manuscripts.ru/mns/main?p_text=26513641>
ГИМ – Государственный исторический музей, г. Москва
РНБ – Российская национальная библиотека, г. Санкт-Петербург
РФФИ – Российский фонд фундаментальных исследований
Син. – Синодальное собрание рукописей Государственного исторического музея
Соф. – Софийское собрание рукописей Российской национальной библиотеки