Как преобразовать нейросетевую модель в другой формат в llama.cpp
Конвертация ИИ-моделей в экосистеме llama.cpp выполняется в два этапа: Пример команды для конвертации модели в формат FP16: python convert_hf_to_gguf.py /path/to/hf/model/ —outtype f16 —outfile model_f16.gguf На втором этапе полученный тяжелый файл GGUF сжимается (квантуется) до нужного уровня битности с помощью инструмента llama-quantize из каталога с собранными файлами llama.cpp (по умолчанию это папка llama.cpp/build/bin). Пример команды для создания кванта Q4_K_M: ./llama-quantize model_f16.gguf model_q4_km.gguf q4_k_m Такой двухэтапный процесс позволяет сначала получить точную копию модели в едином контейнере GGUF, а затем быстро нарезать её на кванты любой нужной битности под конкретные ограничения видеопамяти. Практический пример: конвертация и оптимизация модели Qwen3.8-27B под старое железо Qwen3.8-27B — современная плотная (Dense) vision-language модель на 27 млрд. параметров…
О квантовании AI-моделей для локального инференса
Оригинальные AI-модели от разработчиков обычно публикуются в весах FP16 или BF16. При этом модели имеют довольно большой объем, например, Qwen2.5-VL-72B-Instruct весит примерно 147 ГБ. Конвертация AI-моделей в сжатый формат (квантование), например, в GGUF позволяет запустить эту модель локально на обычном потребительском оборудовании. Правильно подобранный формат модели значительно снижает требования к VRAM и оперативной памяти, помогает оптимизировать процесс вычислений под конкретные аппаратные инструкции. Например, квантованная до 4 бит версия Qwen2.5-VL-72B-Instruct уменьшается в размере до 40-50 ГБ, позволяя запустить её на более доступном железе, в том числе в небольшой домашней сети под управлением llama.cpp. Учитывая большое количество существующих форматов сжатия ИИ-моделей, иногда сложно разобраться, какой из них следует выбрать под свое оборудование.…
Запуск llama.cpp на Nvidia Tesla K40 на Vulkan
Эта статья является продолжением эпопеи с выжиманием AI-соков из старой серверной видеокарты Nvidia Tesla K40, начатой в статьях «Локальный ИИ на Nvidia Tesla K40: сборка и настройка компьютера» и «Запуск llama.cpp на Nvidia Tesla K40».В данном материале описываются результаты работы по сборке бэкенда llama.cpp для Nvidia Tesla K40 под Vulkan. Такой вариант интересен своей универсальностью. При этом не требуется модификация исходников llama.cpp, отвечающих за работу с CUDA, что значительно упрощает не только процесс сборки, но и уменьшает вероятность появления сбоев при работе в составе кластера. Основной проблемой в этом случае является относительно устаревшая версия Vulkan 1.2.175, аппаратно поддерживаемая Nvidia Tesla K40m: Сборка llama.cpp из исходного кода под Vulkan Для сборки…
Запуск llama.cpp на Nvidia Tesla K40 на CUDA
Эта статья является продолжением руководства «Локальный ИИ на Nvidia Tesla K40: сборка и настройка компьютера», в котором описывается настройка операционной системы ubuntu-server 26.04 для работы с патченными драйверами Nvidia 470-й версии. В ней изложена последовательность действий, необходимых для: В конце статьи приведены примеры работы видеокарты Nvidia Tesla K40 с языковыми AI-моделями локально и в составе небольшого кластера с подключением по 2.5Gbit каналу. Развертывание Cuda Toolkit 11.8 в ubuntu 26.04 Установка Cuda Toolkit 11.8 и необходимых для ее работы служебных файлов: wget https://developer.download.nvidia.com/compute/cuda/11.8.0/local_installers/cuda_11.8.0_520.61.05_linux.runsudo sh cuda_11.8.0_520.61.05_linux.run --extract=$HOME/cuda_extractedsudo mkdir -p /usr/local/cuda-11.8/binsudo mkdir -p /usr/local/cuda-11.8/lib64sudo mkdir -p /usr/local/cuda-11.8/includecd $HOME/cuda_extracted Запускаем скрипт, который находит исполняемые файлы инсталляторов внутри папок и распаковывает их в /usr/local/cuda-11.8: for…
Локальный ИИ на Nvidia Tesla K40: сборка и настройка компьютера
Высокие цены на видеокарты и память ограничивают возможности многих желающих локально запускать средние и большие модели ИИ. В связи с этим, при ограниченном бюджете, вызывает интерес возможность использования старых серверных видеокарт.В данной статье рассматриваются возможности инференса и генерации изображений на старой видеокарте Nvidia Tesla K40M с 12GB VRAM, которая у автора около 10 лет провалялась в дальнем ящике… Для этого использовалась материнская плата ASRock H81 Pro BTC R2.0 с BIOS P1.40 (опция Above 4G Decoding активирована по умолчанию, PCIE1 Link Speed выставлен на максимум для этой платы — в Gen2) + CPU Intel i5-4570R (4C/4T), 16 ГБ RAM DDR3 1600MHz, HDD 500GB и сетевая плата Realtek RTL8125B (2.5GBit). Установка последней…
Pulsar Coin (PLSR), майнинг на алгоритме curvehash
Pulsar Coin (PLSR) — это достаточно активно развивающаяся гибридная криптовалюта, сочетающая Proof-of-Work (PoW) и Proof-of-Stake (PoS). Проект создан анонимными разработчиками и позиционирует себя как «fast and secure savings coin» с акцентом на доступный майнинг и стейкинг. Главная фишка — поддержка алгоритма CurveHash, который позволяет майнить как на CPU, так и на GPU, делая сеть более демократичной по сравнению с ASIC-доминируемыми монетами. Проект Pulsar имеет сообщество в Discord, Telegram, Bitcointalk, X и Reddit. Цена монеты PLSR традиционно низкая (на уровне микроскопических долей цента), рыночная капитализация скромная, объёмы торгов небольшие — типичная картина для нишевых CPU/GPU-коинов: Некоторые особенности Pulsar Coin (PLSR): Распределение найденных блоков в сети Pulsar согласно miningpoolstats: Пример конфигурации майнера…
Обзор криптовалюты BTX, майнинг на алгоритме btx
Материал носит информационный характер и не является инвестиционной рекомендацией. Тикер BTX в криптовалютном мире не новость — под ним уже много лет существуют и старый PoW-альткоин Bitcore, и токен биржи Bitci, и ряд других разрозненных проектов. В этом обзоре речь пойдёт о самом свежем носителе этого популярного тикера — блокчейне BTX (репозиторий btxchain на GitHub, документация на сайте btx.dev), запущенном в 2026 году как форк Bitcoin Knots с собственным PoW-алгоритмом, который в майнинг-софте так и называется — btx. Разберём, что это за сеть, кто её развивает, как обстоят дела с ликвидностью и что представляет собой сам алгоритм майнинга. Основные особенности проекта BTX Несмотря на новизну, у BTX уже есть, как…
Криптовалюта PePePow, майнинг PEPEW на алгоритме hoohash-pepew
Материал носит информационный характер и не является инвестиционной рекомендацией PePePow (тикер PEPEW) — одна из немногих PoW-монет мем-сегмента, которая не остановилась в развитии после хайпа 2023 года, а продолжает жить: обновляет кошельки, проводит голосования сообщества и даже меняет алгоритм майнинга. Эта криптовалюта появилась в конце мая 2023 года, после чего проект пережилнесколько изменений алгоритма хеширования (подробнее в статьях О майнинге монет PEPEW на алгоритме xelisv2-pepew иО майнинге монет PEPEW на алгоритме xelisv2-pepew). Сейчас проект использует вычисления на алгоритме hoohash-pepew. В данной статье коротко рассматриваются особенности этой монеты, кто её развивает, как обстоят дела с курсом и капитализацией, и как устроен текущий алгоритм майнинга. Основные особенности PePePow: Кто создал PePePow? Как…
Распределение веса модели в памяти двух видеокарт в stable-diffusion.cpp
Современные диффузионные модели генерации изображений класса DiT (Diffusion Transformers), например, FLUX, для комфортной работы требуют больших массивов видеопамяти (десятки ГБ VRAM). Поэтому их локальный запуск на видеокартах прошлых поколений подчастую является невозможным или трудно реализуемым. Попытка запустить мало-мальски приличную по размеру и возможностям модель на одной карте с объемом 6 ГБ приводят либо к критической ошибке нехватки памяти (Out of Memory, OOM), либо к катастрофическому падению скорости из-за постоянной откачки слоев в системную оперативную память (SysMEM fallback) по относительно медленной шине PCI-Express. В статьях «stable-diffusion.cpp — отличная альтернатива ComfyUI» и «Генерация картинок в zimage-turbo на 6GB видеокарте» были рассмотрены некоторые возможности инференс-движка stable-diffusion.cpp по генерации изображений. При дальнейшем, более глубоком…
Генерация картинок в zimage-turbo на 6GB видеокарте
В предыдущей статье «stable-diffusion.cpp — отличная альтернатива ComfyUI» подробно рассматривались особенности компиляции, тонкой настройки и развёртывания проекта sd.cpp в среде Linux на примере дистиллированной DiT-модели Z-Image-Turbo и гибридной связки из серверного ускорителя Nvidia Tesla V100 и бытовой видеокарты GeForce GTX 1660 Ti. Настоящий материал развивает эту тему и призван ответить на практический вопрос: насколько эффективно современный инференс-движок на базе библиотеки GGML справляется с генерацией изображений на аппаратных конфигурациях начального уровня, лишённых специализированных тензорных ядер (Tensor Cores). В качестве основного вычислительного узла в статье рассматривается та же Nvidia GeForce GTX 1660 Ti с 6GB VRAM (архитектура Turing). Физический объём её видеопамяти накладывает жёсткие ограничения: в него способны уместиться лишь легковесные квантованные…



































