Если у вас 8 гб оперативной памяти — даже не пытайтесь устанавливать модели с объёмом параметров от 7 млрд, вроде qwen 2.5 7b или llama 3.1 8b. Я ставил qwen 2.5 7b, так у меня лаги были такие, что думал ноут просто сгорит
Вам могут посоветовать установить модель на 3 млрд параметров вроде qwen 2.5 3b, но она справляется хорошо только с задачами формата «исправить орфографические ошибки в тексте». На большее она не годится.
Там можно создать API key, который нужно добавить в AnythingLLM как провайдера. Выбирайте модель gemini 2.5 flash, либо версию pro если она работает у вас (у меня нет, четырёхсотит).
Free tier тариф именно для моделей семейства flash работает на лимитах, которые вы вряд ли когда-либо выработаете. Точных цифр нет, но это примерно до 1500 запросов в день. Для других моделей лимиты могут быть другими.
Только не забывайте, что в отличие от локальных моделей, проприетарные используют ваши данные для обучения моделей. Так что не лейте в чат чувствительные данные.
Google кстати открыто пишет, что в платных тарифах он не собирает данные. Что ж, верим


