Продвинутая модель ИИ, работающая у вас дома бесплатно — но способен ли ваш компьютер её запустить?
Команда Qwen компании Alibaba выпустила Qwen3.8-27B — открытую модель искусственного интеллекта, которую можно скачать и запустить локально, без API-ключей, без пожетонной оплаты и без передачи данных в облако.
Веса модели опубликованы на Hugging Face и ModelScope под лицензией Apache 2.0, которая разрешает в том числе и коммерческое использование при соблюдении условий лицензии. Это плотная (dense) модель объёмом около 27 миллиардов параметров, включающая зрительный кодировщик (vision encoder) и поддерживающая работу с текстом, изображениями и видео.
Модель обладает нативным контекстным окном в 262 144 токенов, которое можно расширить до 1 миллиона токенов с помощью YaRN. Она способна работать в режиме рассуждений (reasoning), переключаться на прямые ответы и выполнять сложные задачи, включающие написание кода, использование внешних инструментов и управление компьютерным окружением.
Значительный скачок в производительности
Цифры, опубликованные командой Qwen, показывают заметное улучшение по сравнению с Qwen3.6-27B, хотя обе модели находятся в одной весовой категории.
В бенчмарке SWE-bench Pro, проверяющем решение задач и исправление багов в репозиториях кода, результат вырос с 53,5 до 61,7. В Terminal-Bench 2.1, оценивающем выполнение задач через терминал, зафиксирован рост с 63,4 до 73,0.
Самый большой скачок отмечен в OSWorld-Verified — тесте, имитирующем реальное управление компьютером, включая работу с окнами, меню и приложениями. Там показатель поднялся с 63,9 до 84,3. Согласно официальной карточке модели, этого прогресса удалось добиться без существенного увеличения количества параметров.
Впрочем, стоит умерить восторг: это результаты, опубликованные самой командой Qwen, причем часть тестов проводилась в тестовой среде и с настройками, выбранными компанией. На данном раннем этапе пока недостаточно независимых проверок, которые подтвердили бы аналогичную производительность при домашнем запуске и в повседневных сценариях.
Действительно ли она работает на одной видеокарте?
Да, но ответ зависит от скачиваемой версии и длины диалога.
Пакет Q4_K_M, доступный сегодня в Ollama, весит около 18 ГБ, включая квантованную модель и зрительный кодировщик. Это означает, что её можно запустить на ПК с видеокартой на 24 ГБ VRAM, такой как RTX 4090, но только с ограниченным контекстным окном и с учётом памяти, необходимой самому движку.
RTX 5090 оснащена 32 ГБ памяти, что даёт больший запас для весов, контекста и дополнительных операций. Компьютеры Mac с объёмом объединённой памяти (Unified Memory) от 32 ГБ также способны запустить 4-битную версию, но производительность и объём контекста будут зависеть от конкретной модели, операционной системы и программы для запуска.
Полноценная версия BF16 требует около 56 ГБ только под веса модели, без учёта памяти под контекст и системных расходов. Это уже выходит за рамки типичного запуска на обычном домашнем ПК.
Ловушка кроется в памяти контекста
Размер файла модели — это лишь часть истории. Чем длиннее диалог, документ или репозиторий кода, тем больше памяти требуется для сохранения контекста.
Согласно опубликованной архитектуре модели, KV-кэш в слоях полного внимания может достигать около 64 КБ на каждый токен в BF16. Таким образом, полное окно в 262 тысячи токенов требует примерно 16 ГБ дополнительной памяти — и это ещё до учета накладных расходов системы и других компонентов.
На практике видеокарта с 24 ГБ памяти может запустить 4-битную версию, но не способна одновременно удержать в VRAM и веса, и всё нативное контекстное окно. Расширение до 1 миллиона токенов с помощью YaRN может потребовать более 60 ГБ только для памяти контекста.
Поэтому обычно предпочтительнее квантованная версия со свободным запасом памяти, чем более точная, которая работает на пределе возможностей и сбоит посреди задачи.
Как запустить модель
Самый простой способ — установить Ollama и выполнить команду: ollama run qwen3.8:27b
Эта команда скачивает модель и запускает её. Команда ollama pull qwen3.8:27b только скачивает файлы, не открывая чат.
Также можно запускать GGUF-версии через llama.cpp или выбрать подходящее квантование в LM Studio. При этом важно проверять, кто создал конвертацию: многие GGUF-файлы и MLX-версии распространяются участниками сообщества, а не самой командой Qwen.
Бесплатно — но не даром
Сама модель доступна для скачивания бесплатно, и плата за запросы отсутствует. Тот, у кого уже есть мощный ПК, фактически получает локального ИИ-помощника, способного работать без постоянного подключения к облаку.
Однако оборудование, энергопотребление и тепловыделение не бесплатны. Длительный запуск нагружает видеокарту, потребляет электричество и может помешать параллельному использованию ПК для игр или работы с графикой.
Полная конфиденциальность также зависит от сценария использования: диалог остается на компьютере, пока модель работает локально, но подключение к внешним инструментам, поисковикам или сервисам может приводить к передаче информации им.
Qwen3.8-27B не превращает домашний компьютер в серверную ферму, но в очередной раз сокращает разрыв между локальными моделями и облачными ИИ-сервисами. Для тех, у кого уже есть подходящее железо и кто готов ограничиться более реалистичным контекстным окном, это одна из самых интересных локальных моделей, выпущенных в этом году.

























