Ollama
Запустить локальную модель одной командой — звучит красиво, пока не выясняется, что контекст молча урезан до 2048 токенов, а GPU на Windows 11 так и не подхватился. В разделе делятся опытом самостоятельного инференса: сравнивают Ollama с llama.cpp и vLLM, разбирают форматы GGUF, AWQ и GPTQ, ловят VRAM и лишние ватты, которые карта жрёт в простое. Хорошая точка входа для тех, кто хочет гонять LLM на своём железе без облачных API.
17 тем, 106 ответов, 3748 просмотров · все теги
Похожие теги:
llama.cpp 6vLLM 4LLM 3vram 3холивар 3GPU 2локальные-llm 2C++ 1Self-hosting 1windows 1DeepSeek 1помощь 1modelfile 1промпт 1настройка 1
- Темы
-
- Оллама после обновления выгружает модель каждые 5 минут, как лечить
в «Локальные LLM и open-source модели» · 5 ответов · 52 просмотров · 11 июн 2026, 07:26
-
- Снёс Ollama после двух лет — переехал на llama.cpp + llama-swap и пока не жалею. Переубедите?
в «Локальные LLM и open-source модели» · 4 ответов · 58 просмотров · 10 июн 2026, 16:39
-
- ollama в 2026, кто-то еще пользуется или все переросли
в «Локальные LLM и open-source модели» · 7 ответов · 74 просмотров · 10 июн 2026, 09:28
-
- DeepSeek R1 8B на 6GB VRAM запустить реально или нет ✓ Решено
в «Локальные LLM и open-source модели» · 8 ответов · 74 просмотров · 09 июн 2026, 05:27
-
- Llama 4 Scout 17B локально — реально работает на 24GB или опять маркетинг?
в «Локальные LLM и open-source модели» · 6 ответов · 57 просмотров · 09 июн 2026, 04:46
-
- Ollama vs llama.cpp vs vLLM - что выбрать в 2026, запутался окончательно
в «Локальные LLM и open-source модели» · 10 ответов · 827 просмотров · 09 июн 2026, 03:47
-
- Ollama 0.24 + Qwen3.6 MTP: реально ли ~2x скорости на домашней карте?
в «Локальные LLM и open-source модели» · 5 ответов · 50 просмотров · 08 июн 2026, 16:39
-
- Ollama после обновления стала жрать в 2 раза больше RAM, у кого так же?
в «Локальные LLM и open-source модели» · 0 ответов · 26 просмотров · 08 июн 2026, 10:39
-
- Ollama как настроить системный промпт и параметры генерации ✓ Решено
в «Локальные LLM и open-source модели» · 6 ответов · 67 просмотров · 06 июн 2026, 13:51
-
- GPU в простое жрёт VRAM и 70 ватт, хотя ничего не крутится
в «Локальные LLM и open-source модели» · 4 ответов · 334 просмотров · 06 июн 2026, 09:43
-
- Неделю дебажил 'тупую' модель, а это Ollama резала контекст до 2048
в «Локальные LLM и open-source модели» · 6 ответов · 546 просмотров · 06 июн 2026, 04:22
-
- vLLM vs Ollama vs TGI для self-hosted инференса — что в проде у вас?
в «Машинное обучение и Data Science» · 9 ответов · 875 просмотров · 05 июн 2026, 23:28
-
- Ollama не видит GPU на Windows 11 что делать ✓ Решено
в «Локальные LLM и open-source модели» · 6 ответов · 68 просмотров · 05 июн 2026, 22:34
-
- AWQ или GPTQ для vLLM в 2026, и причём тут вообще GGUF
в «Локальные LLM и open-source модели» · 8 ответов · 479 просмотров · 04 июн 2026, 19:11
-
- Ollama vs llama.cpp напрямую — реально ли 23% разница в скорости или маркетинг?
в «Локальные LLM и open-source модели» · 6 ответов · 67 просмотров · 01 июн 2026, 15:21
-
- Почему в 2026 каждый туториал по локалкам начинается с ollama
в «Локальные LLM и open-source модели» · 8 ответов · 49 просмотров · 25 май 2026, 08:09
-
- Ollama в проде, нормальная практика или зашквар
в «Локальные LLM и open-source модели» · 8 ответов · 45 просмотров · 24 май 2026, 18:27
Популярные запросы по теме:
как запустить llama локальноqwen vs llama что лучшечто такое linux и чем он отличается от windows · все запросы →