Порада для постапокаліпсису :), або як запустити LLM локально, коли не буде інтернету? Зробіть це ЗАРАЗ :)
Ми звикли щодня використовувати AI в роботі. А тепер уявіть, що інтернету немає. ChatGPT, Claude, Gemini та інші сервіси працюють у чужих дата-центрах. Ми маємо доступ до потужних моделей, доки є мережа. Що можна зробити на випадок відсутності інтернету? Треба використовувати свій «дата-центр» і робити обчислення «локально», тобто на власних обчислювальних потужностях.
📎 Коротко: різниця — де крутиться модель і хто нею володіє
Claude (як і GPT, Gemini) — хмарна закрита модель. Сама модель — це файл з мільярдами чисел («ваги»), він лежить на серверах Anthropic. Ви його ніколи не бачите. Текст відправляють через API → на їхньому залізі рахується відповідь → вам повертається результат. Як електрика з розетки: користуєтеся, але електростанція не ваша.
Локальна модель — той самий файл з вагами, але лежить у вас на Mac. Ви завантажуєте файл (умовно 5–100 ГБ), запускаєте програму для його обробки — і всі обчислення відбуваються безпосередньо на вашому процесорі чи відеокарті. Інтернет не потрібен, а ваші дані нікуди не передаються.
Що таке відкрита модель?
Тут є розповсюджена плутанина.
Open weights (відкриті ваги) — компанія викладає сам файл моделі у вільний доступ. Качайте, запускайте, донавчайте, вбудовуйте у свій продукт. Але як саме її тренували, на яких даних і яким кодом — не кажуть. Це 95% того, що люди називають «відкритими моделями»: Llama (Meta), Qwen (Alibaba), DeepSeek, Mistral, Gemma (Google), gpt-oss (OpenAI).
Open source у справжньому сенсі — коли відкриті ще й дані, код тренування, рецепт. Таких мало і вони слабші.
Закрита — Claude, GPT, Gemini. Ваг не існує ніде, крім серверів компанії.
Тобто «відкрита» ≈ «ви маєте сам двигун», а не «знаєте, як його зібрали». І ліцензії теж різні: Llama має обмеження на дуже великі продукти, Qwen/Mistral переважно Apache 2.0 (робіть, що хочете, навіть комерційно).
📲 Як я юзаю відкриті моделі локально?
Головне — це легко.
Для цього використовую LM Studio. Безкоштовно, працює на macOS, Windows і Linux. Завантажуєте потрібну модель на комп'ютер — і далі можете працювати з нею без інтернету.
Я встановив три моделі на MacBook Pro M4 Pro з 24 ГБ пам'яті:
▪️Qwen3.8 9B Heretic Uncensored — 6,3 ГБ
▪️Ornith 1.5 9B Uncensored 8bit — 10,5 ГБ
▪️google/gemma-4-e4b — 6,9 ГБ
Мені подобається мати кілька моделей, тому що вони можуть по-різному помилятися і по-різному інтерпретувати одне й те саме питання. Це, до речі, хороший спосіб перевіряти відповіді. Якщо кілька різних моделей дають однаковий результат, більше їм довіряю. Якщо відповіді сильно відрізняються — варто перевірити інформацію окремо.
Скільки потрібно пам'яті?
Для локальних моделей важлива саме оперативна пам'ять.
Орієнтовно:
▪️ 16 ГБ — можна комфортно працювати з моделями близько 9B у 4-бітному форматі;
▪️ 24 ГБ — можна використовувати 9B у 8-бітному форматі або більші моделі;
▪️ 32 ГБ і більше — відкривається можливість працювати з моделями близько 27B.
Навіщо це ставити?
Бо якщо станеться кінець світу, буде трошки спокійніше: будете знати, як перев'язати рану, полагодити двигун чи щось інше :). Ну а може, не кінець світу, а кінець інтернету, — теж буде корисно :)
p.s.
До речі, у Netpeak працює новий напрям — AI Solutions by Netpeak. Команда допомагає бізнесу впроваджувати AI-агентів, ML-моделі та автоматизувати рутину.
А за лінком можете послухати наш подкаст із Сергієм Саутою, CAIO FRACTAL.
Інші дописи про AI-ботів, які ви легко можете зробити самі:
✅ Кейс ШІзації №1. Зібрав собі редакцію: 25 корисних подкастів, 13 світових медіа
✅ 🤖 Кейс ШІзації №2. Створюємо власноруч AI-бот, який робить зустріч із переписки.
Частина 1
Частина 2
✅ Кейс ШІзації №3. Створив персонального AI-коуча: він контролює мене, щоб я виконував власні цілі, і це реально працює :)
III > I
ask digital me: artemborodatiukbot
watch: YouTube
services and products of FRACTAL: BDO
join: managers community
work with me: Вакансії
my experience in algorithms: «Книга Для менеджерів»
follow: TikTok • Instagram • Threads