Ollama

Запустить локальную модель одной командой — звучит красиво, пока не выясняется, что контекст молча урезан до 2048 токенов, а GPU на Windows 11 так и не подхватился. В разделе делятся опытом самостоятельного инференса: сравнивают Ollama с llama.cpp и vLLM, разбирают форматы GGUF, AWQ и GPTQ, ловят VRAM и лишние ватты, которые карта жрёт в простое. Хорошая точка входа для тех, кто хочет гонять LLM на своём железе без облачных API.

17 тем, 106 ответов, 3748 просмотров · все теги

Похожие теги: llama.cpp 6vLLM 4LLM 3vram 3холивар 3GPU 2локальные-llm 2C++ 1Self-hosting 1windows 1DeepSeek 1помощь 1modelfile 1промпт 1настройка 1
  • Темы
Популярные запросы по теме: как запустить llama локальноqwen vs llama что лучшечто такое linux и чем он отличается от windows · все запросы →