AI и DIY
Записи о DIY-проектах, связанных с 3D-обработкой, печатью и лазерной гравировкой, изготовлением и модернизацией станков с числовым-программным управлением и связанного с этим оборудования,
llama.cpp на двух компьютерах через прямое соединение
Для увеличения доступного объема VRAM при локальных AI-вычислениях можно использовать распределённый инференс больших моделей между двумя машинами, соединёнными патч-кордом напрямую (без свитча), через встроенный RPC-backend llama.cpp. Он специально создан для распараллеливания инференса одной нейросети на нескольких компьютерах (технология pooling VRAM — запуск моделей, которые не влезают в память одной видеокарты). В режиме rpc одна машина выступает координатором (запускает llama-cli или llama-server), другая — вычислительным узлом (rpc-server), который просто исполняет операции над тензорами по сети. При этом слои модели распределяются между локальными GPU и удалёнными узлами. Важно понимать ограничения такой «солянки»: Это не настоящий tensor-parallelism с overlap вычислений и передачи данных, здесь каждый слой считается последовательно, и пока узел B не…
ComfyUI генерирует чёрный квадрат/артефакты вместо изображения. Что делать?
Иногда после успешного прохождения цикла генерации в ComfyUI вместо ожидаемого изображения появляется чёрный квадрат, серый шум, сильные цветовые артефакты или полностью испорченная картинка. Пример сбоя (промпт: «A fashion photography work full of surreal romanticism, using a low-angle upward shooting composition, with a clear light blue sky as the background, and the visual focus concentrated on the fantasy blue vegetation and the model walking through it»): Генерация «Черного Квадрата» Малевича вместо желаемого промта: Подобные ошибки могут возникать из-за следующих причин: Чтобы исправить генерацию цветового шума/черных квадратов вместо желаемого изображения можно использовать следующие способы: Рекомендуется использовать надёжный VAE, например: Кроме того, можно попробовать добавить Load VAE → VAEDecode из стандартных официальных нод,…
«Никелирование» llama.cpp на компьютере с несколькими GPU Nvidia
Программное окружение llama.cpp является одним из лучших инструментов для работы с локальными AI-моделями. Сообщество активно развивает проект: регулярно появляются новые оптимизации, поддержка аппаратных ускорений и рост скорости инференса. Одной из «фишек» llama.cpp является поддержка практически любых видеокарт, а также возможность распределения больших AI-моделей на нескольких видекоартах. В этом случае большое влияние на скорость проведения вычислений оказывает полоса пропускания общей шины памяти, то, насколько быстро производится обмен данными между GPU, CPU и RAM компьютера. Упрощенная формула для расчета скорости инференса в зависимости от пропускной способности памяти: Реальная скорость проведения вычислений ниже теоретической, зависит от bandwidth памяти и скорости interconnect между картами. Из-за различных задержек система выдает около 60–90% от максимума. Для…
Отключение USB‑контроллеров и аудио-устройств видеокарт для освобождения ресурсов шины PCI-E в Linux
Для ускорения инференса в multiGPU-системе критически важно обеспечить максимальную пропускную способность обмена между видеокартами по шине PCI-E. Для этого можно отключить все неиспользуемые устройства, подключенные к ней, например, аудио, а также обычно неиспользуемые VirtualLink USB-контроллеры видеокарт (работают через DisplayPort на VR-устройствах). Снижение нагрузки на шину PCI-E, уменьшение потребления ресурсов, отключение ненужных драйверов улучшит стабильность и производительность системы, что особенно важно в мульти-GPU конфигурациях. Изучить информацию о подключении видеокарт Nvidia к шине PCI-E можно по команде: lspci | grep -E "USB|Audio" | grep -i nvidia 01:00.1 Audio device: NVIDIA Corporation TU116 High Definition Audio Controller (rev a1)01:00.2 USB controller: NVIDIA Corporation TU116 USB 3.1 Host Controller (rev a1)01:00.3 Serial bus controller:…
Устранение ошибки RuntimeError: comfy-aimdo device is not initialize в comfyui
Для решения проблем с нехваткой памяти при работе с нейросетями и платформой PyTorch часто используется модуль AIMDO (AI Model Dynamic Offloader), который автоматически выгружает часть модели искусственного интеллекта в системную память при переполнении VRAM. Благодаря этому даже на компьютерах с относительно слабыми видеокартами с малым объемом памяти можно запускать крупные модели AI. В окружении comfyui распределитель памяти AIMDO можно командой: python -m pip install --upgrade comfy-aimdo К сожалению, при запуске AI-моделей в comfyui с одновременным использованием AIMDO и ноды MultiGPU (например, для загрузки CLIPTextEncoder в память другой видеокарты) может появляться ошибка RuntimeError: comfy-aimdo device is not initialize: Она появляется из-за того, что модуль динамической памяти AIMDO при загрузке окружения comfyui…
Запуск AI-моделей в llama.cpp на AMD Radeon RX470 8GB с Vulkan в gentoo
Использование искусственного интеллекта в настоящее время стало обыденностью. По ряду причин, имеет смысл ограничивать объем персональных данных, отдаваемых «Большому Брату» в ходе его использования. При наличии мало-мальски производительного компьютера (16GB+ RAM и 8GB+ VRAM) на нем можно запускать локальные AI-приложения, избавившись от необходимости платить за подобные сетевые услуги, а также сократив объем своего «личного дела» у третьих лиц. Для запуска локального AI удобно использовать программное окружение llama.cpp. Среди его преимуществ можно выделить следующие: В наличии множества пользователей до сих пор имеется множество видеокарт AMD поколения Polaris с 8GB памяти (AMD Radeon RX серий 470-590). Несмотря на частичное прекращение поддержки таких графических ускорителей (например, на них невозможно использовать последние версии rocm),…
Активация FlashAttention в comfyui для Nvidia Tesla V100 в linux
AI-вычисления требуют наличия большого объема быстродействующей памяти, а также использования новейшего программных модулей, в полной мере раскрывающих возможности имеющегося оборудования. Для видеокарты Nvidia Tesla V100 в comfui для этого можно установить модули Triton 3.2.0 и SageAttention 1.0.6: pip install sageattention==1.0.6 triton=3.2.0 Для еще большего увеличения быстродействия вычислений на видеокарте Nvidia Tesla V100 (и на других подходящих ускорителях) в comfyui желательно использовать программный модуль FlashAttention. В нем задействован алгоритм эффективного вычисления внимания (attention) в AI-трансформерах, который значительно ускоряет инференс и уменьшает загрузку памяти на GPU. Технология FlashAttention (Fast and Memory-Efficient Exact Attention with IO-Awareness) использует оптимизированный алгоритм работы с памятью GPU, включающий следующие элементы: Благодаря FlashAttention, сохраняя тот же математический результат,…
О ремонте десктопной DDR4-памяти
Бурное развитие программного обеспечения, связанного с искусственным интеллектом привело к значительному подорожанию видеокарт и оперативной памяти. Даже модули RAM старых поколений, например, на чипах DDR4, выросли в цене. В связи с этим стала востребованной реанимация неисправных планок памяти большого объема, либо установка более современных и емких микросхем памяти на старые модули. Если производится замена 1-2 микросхем памяти или SPD-чипа, такой ремонт вполне оправдан. В данной статье сделана попытка собрать информацию, которая поможет в ремонте памяти DDR4 SDRAM UDIMM, использующейся на домашних компьютерах. Материал, изложенный далее, субъективен и не претендует на полноту. Устройство десктопной памяти DDR4 SDRAM UDIMM DDR4 SDRAM UDIMM (Unbuffered Dual In-line Memory Module) представляет собой печатный модуль, который…
Компиляция и работа с llama.cpp для GPU Nvidia в linux
Запуск серьезных AI-моделей на своем оборудовании требует большого количества быстродействующей памяти и высокой производительности большинства компонентов компьютера. Использование наиболее эффективных программ может значительно увеличить скорость вычислений при работе с искусственным интеллектом. Самостоятельная сборка пакета программ llama.cpp позволит получить максимальную отдачу от своего оборудования, используя новейшие программнные модули, библиотеки и флаги оптимизации. Для этого очень хорошо подходит операционная система gentoo, в которой все модули по умолчанию компилируются под конкретное железо. Например, в lmstudio нет совместимой c cuda12 версии runtime для видеокарт старее compute capability 7.5, хотя адаптеры поколений Maxwell, Pascal и Volta могут полноценно работать с CUDA Runtime 12.x. По состоянию на середину апреля 2026 года со старыми графическими ускорителями Nvidia…
Установка и использование ollama в gentoo
При наличии мало-мальски мощного компьютера можно достаточно легко запустить свой искусственный интеллект, независимый от кого бы то ни было. Он будет работать без слежки и цензуры, при отключенном интернете, бесплатно и приватно. Собственную AI-модель можно натренировать под свои нужды, улучшив ее IQ в целевой сфере. Локальный искусственный интеллект можно использовать для написания программ, анализа и написания текстов, изучения и генерации изображенийи т.д. ИИ-модель может работать в качестве персонального ассистента-секретаря, не требующего выходных и премий. Учитывая высокий темп развития нейросетевых технологий, глубокого машинного обучения и достаточно высокую вычислительную мощность бытовых современных компьютеров, программные ИИ-помощники скоро станут обыденностью, как смартфоны и другие электронные гаджеты. Для запуска ИИ на компьютере можно использовать такие…































