DH CLOUD: post #370 — TG.ME

Опубликован Русский стилеметрический датасет. Это собрание готовых наборов текстов для исследований и учебных занятий. Датасет позволяет ученым и педагогам не тратить время и силы на подбор текстов для тестирования своих методик или для подготовки к работе над темой стилеметрии в классе.

Все включенные в датасет тексты находятся в общественном достоянии и распределены по подкорпусам, ориентированным на специфические задачи:

↪️ Художественная проза по периодам (XVIII, XIX – первая/вторая половина, рубеж XIX–XX вв.)
↪️ Тексты по полу, возрасту и поколению авторов
↪️ Публицистика и научные тексты (история, богословие, психофизиология, философия)
↪️ Жанровая классификация
↪️ Литературные и идеологические направления (романтизм vs реализм, западники vs славянофилы)
↪️ Стих и проза (включая стихотворные размеры)
↪️ Речь персонажей (из прозы и драматургии)
↪️ Сгенерированные тексты (LSTM и GPT)

(всего 25 подкорпусов)

Объем датасета: 322 документа, ~16 млн слов, 94 автора.

Тексты оптимизированы для работы в stylo, что не ограничивает в работе с другими инструментами.

Формат файлов: plain text, кодировка UTF-8.

Схема именования: автор_название.txt, что позволяет пакету stylo автоматически выделять одним цветом тексты, принадлежащие одному классу (например, одному автору).

Каждый подкорпус содержит сопроводительный файл README.md с описанием кодировки названий и указанием источников, а также файл corpus.tsv с метаданными в машиночитаемой форме.

Для проверки консистентности данных и отсутствия дубликатов в состав включен набор автоматических тестов (tests/).

DOI: 10.5281/zenodo.20701309
🔥11❤5👎1👏1
June 15, 2026 3.8K 95