Все включенные в датасет тексты находятся в общественном достоянии и распределены по подкорпусам, ориентированным на специфические задачи:
(всего 25 подкорпусов)
Объем датасета: 322 документа, ~16 млн слов, 94 автора.
Тексты оптимизированы для работы в
stylo, что не ограничивает в работе с другими инструментами.Формат файлов:
plain text, кодировка UTF-8.Схема именования:
автор_название.txt, что позволяет пакету stylo автоматически выделять одним цветом тексты, принадлежащие одному классу (например, одному автору).Каждый подкорпус содержит сопроводительный файл
README.md с описанием кодировки названий и указанием источников, а также файл corpus.tsv с метаданными в машиночитаемой форме.Для проверки консистентности данных и отсутствия дубликатов в состав включен набор автоматических тестов (
tests/).DOI: 10.5281/zenodo.20701309




