Выяснилось, что при большой истинной размерности облака они дают систематически заниженную оценку этой размерности. При чем чем больше настоящая размерность, тем сильнее занижается оценка.
Я решила проверить это и навайбкодила ноутбук, в котором генерируются облака точек, равномерно заполняющие n-мерные шары:
https://colab.research.google.com/drive/1kIRin8sBBNQDFvruXWITU3i5kL7x7Zww?usp=sharing
Краткие результаты:
- При размерности такого шара 10 и количестве точек 2000, три алгоритма оценки размерности (PHD, TwoNN и MLE) дают что-то между 8.5 и 9, то есть занижают незначительно. А вот при размерности 100, PHD уже даёт оценку в 64, а TwoNN и MLE и вовсе около 50, то есть оценка занижена в целых два раза (см. рис. 1).
- Увеличение количества точек в шаре может помочь подтянуть оценку к истинной, но, похоже, что для этого увеличивать их количество нужно экспоненциально с ростом размерности.
Интересные выводы, и вообще даже странно, что раньше я не знала о таком явлении. Или знала, но забыла?
В любом случае, надеюсь, что эта инфа будет полезна всем, кто интересуется внутренней размерностью и т.д.
P S В случае любых ошибок в ноутбуке - все претензии к Клоду
#эксперимент #наука





