▸тюнинг
за основу взята модель qwen3.5-9b, ведь в этой весовой категории, кроме gemma4-e4b, нету нормальных моделей. qwen мне всегда был ближе, поэтому и выбрала его. датасет для тренировки модели состоял из нескольких других датасетов, все, кроме одного, что я взяла, были на английском языке, благо у меня была возможность использовать deepseek-v4-pro, а потом deepseek-v4-flash для перевода. deepseek, на самом деле, самые нецензурные модели среди остальных гигантов. при переводе не было ни одного отказа, разве что тогда, когда модель глупила и воспринимала текст для перевода как просьбу. в итоге вышло примерно 42M токенов для тренировки модели, что на самом деле мало. в результате, спустя десятки перетренировок и тестов была опубликована модель.
▸что вышло
изначально, за первые три дня модель набрала около 3000 установок суммарно. но проблема была в том, что опубликованная мною модель была повреждена из-за проблем с мультимодальностью qwen. увидев комментарий об этом под чужой квантизацией моей модели, я поняла, что этот небольшой хайп вокруг модели был впустую. жалко было не из-за возможности получить больше установок и популяризации модели, а из-за того, что люди не попробовали модель и не дали фидбэка.
сейчас модель исправна. GGUF-кванты от mradermacher пока всё ещё битые (скоро поправит), поэтому используйте мои.
UPD: кванты у mradermacher исправлены












