Qwen3.6:35b — это бесплатная LLM-модель для разработки AI-агентов со сложными цепочками рассуждений.
Qwen3.6:35b предустановлена на серверах в Нидерландах, Финляндии, Германии, Исландии, США, Турции, Польше, Англии, Франции, Испании, Швейцарии и России.
Арендуйте виртуальный (VPS) или выделенный сервер с Qwen3.6:35b — бесплатной LLM-моделью для разработки AI-агентов со сложными цепочками рассуждений. Выберите Qwen3.6:35b, сконфигурируйте сервер и приступите к работе уже через 15 минут.
Qwen3.6:35b предоставляется только для арендованных серверов HOSTKEY. Для автоматической установкиQwen3.6:35b выберите это ПО во вкладке «Маркетплейс приложений» при заказе услуги.
Арендуйте надежный VPS в Европе, США и Турции.
Готовность: ≈15 минут.
Арендуйте выделенный сервер в Европе, США и Турции.
Готовность: ≈15 минут.
Qwen3.6:35b — это бесплатная платформа с открытым исходным кодом, доступная по лицензии GNU General Public License v2.0.
Мы гарантируем, что на сервере установлено безопасное оригинальное программное обеспечение.
Чтобы установить Qwen3.6:35b, нужно выбрать это приложение во время заказа сервера на сайте HOSTKEY. Наша система автоматического деплоя произведет установку программного обеспечения на ваш сервер.
Если у вас возникли вопросы или затруднения при использовании Qwen3.6:35b, внимательно изучите документацию на официальном сайте разработчика или обратитесь в службу поддержки Qwen.
Qwen3.6 — это передовое семейство больших языковых и мультимодальных LLM-моделей с открытыми весами, которые оптимизированы для сложного агентного программирования, работы с огромным контекстом (до миллиона токенов) и продвинутого мультимодального анализа.
Qwen3.6-35B-A3B — открытая модель команды Qwen компании Alibaba, веса опубликованы в апреле 2026 года под лицензией Apache 2.0. В ней 35 млрд параметров, из которых на каждый токен работают около 3 млрд: это разреженная смесь экспертов, поэтому скорость близка к трехмиллиардной модели. Контекст — 262 тысячи токенов, с расширением примерно до миллиона. Модель заточена под работу с кодом и автономные сценарии, принимает текст, изображения и видео. Запускается на арендованном сервере с видеокартой от 24 ГБ.
Суффикс A3B в названии означает количество активных параметров: около 3 млрд из 35 млрд общих. Это первая открытая модель поколения Qwen3.6, до нее семейство было доступно только через интерфейс программирования.
|
Параметр |
Значение |
|
Разработчик |
команда Qwen, Alibaba |
|
Публикация весов |
апрель 2026 |
|
Всего параметров |
35 млрд |
|
Активных на токен |
около 3 млрд |
|
Архитектура |
разреженная смесь экспертов, 256 экспертов |
|
Контекст |
262 144 токена, расширяется примерно до 1 млн |
|
Ввод |
текст, изображения, видео |
|
Лицензия |
Apache 2.0 |
Официальный разбор с результатами тестов разработчик опубликовал в анонсе модели.
Qwen3.6-35B-A3B позиционируется как модель для работы с кодом и автономных сценариев, а не как универсальный собеседник. По опубликованным разработчиком замерам она набирает 73,4% на наборе задач SWE-bench Verified и 51,5% на Terminal-Bench 2.0 — это уровень, который раньше показывали заметно более крупные плотные модели.
Где это применимо на практике:
Отдельная особенность — сохранение рассуждений между сообщениями. Модель удерживает ход мысли из предыдущих шагов, и в длинных сценариях это заметно снижает расход токенов на повторное объяснение контекста.
В модели 256 экспертов, из которых на каждый токен активируются восемь маршрутизируемых и один общий. Отсюда и разрыв между общим и активным размером.
Внимание устроено гибридно: слои линейного внимания чередуются со слоями обычного управляемого внимания. Первые дешевле по памяти на длинных последовательностях, вторые точнее удерживают связи между удаленными частями текста. Такое чередование и позволяет держать контекст в сотни тысяч токенов без пропорционального роста расхода памяти.
Важное следствие для планирования сервера: экономия идет по вычислениям, а не по памяти. В видеопамять нужно уложить все 35 млрд параметров, потому что маршрутизатор в любой момент может обратиться к любому эксперту. Считать конфигурацию по трем миллиардам активных — самая частая ошибка при первом развертывании.
Расчет идет от 35 млрд параметров и разрядности весов. Цифры ниже — ориентиры под веса, без кеша внимания.
|
Разрядность |
Вес модели |
Нужно видеопамяти |
Карта |
|
16 бит |
около 70 ГБ |
от 80 ГБ |
две карты по 48 ГБ или одна на 80 ГБ |
|
8 бит |
около 35 ГБ |
от 48 ГБ с длинным контекстом |
RTX A6000 48 ГБ |
|
4 бита |
около 18 ГБ |
от 24 ГБ |
RTX A5000 24 ГБ, RTX 5090 32 ГБ |
Отдельно стоит сказать то, чего обычно не пишут на страницах аренды: карты на 16 ГБ для этой модели не подходят даже при четырехбитном квантовании. RTX A4000 и другие решения этого класса стоит рассматривать под модели поменьше. Если бюджет упирается в 16 ГБ, разумнее взять плотную модель на 27 млрд параметров, а не пытаться ужать эту.
Практический ориентир: 24 ГБ дают рабочий четырехбитный вариант, 48 ГБ — восьмибитный с длинным контекстом.
Штатное контекстное окно — 262 144 токена. Механизм масштабирования позиционного кодирования расширяет его примерно до миллиона, но за это платят и качеством на краях окна, и памятью.
Что делают на практике:
Последний прием обычно эффективнее наращивания окна: он и дешевле по памяти, и точнее по результату.
Обе модели — открытые смеси экспертов под Apache 2.0, обе доступны в маркетплейсе. Выбор определяется задачей.
|
Критерий |
Qwen3.6 35B A3B |
Gemma 4 26B A4B |
|
Всего параметров |
35 млрд |
25,2 млрд |
|
Активных на токен |
около 3 млрд |
около 4 млрд |
|
Минимум видеопамяти |
24 ГБ |
16 ГБ |
|
Контекст |
262K, расширяется до 1 млн |
256K |
|
Сильная сторона |
работа с кодом и автономные сценарии |
универсальные задачи и работа с документами |
Коротко: под разработку и автономные сценарии берут Qwen, под общие задачи и меньший бюджет по видеопамяти — Gemma 4 26B. Обе можно развернуть на одном сервере и сравнить на своих задачах.
Apache 2.0 разрешает коммерческое использование, изменение и распространение производных моделей, включая дообученные под конкретную задачу. Отдельного согласования с разработчиком не требуется, ограничений по областям применения лицензия не содержит.
Запуск на своем сервере имеет смысл, когда важен хотя бы один пункт: код и внутренняя документация не должны уходить наружу, нагрузка постоянная и почасовая оплата внешнего сервиса выходит дороже аренды, нужна доработка модели под свой стек. Для российских компаний добавляется правовой аргумент: если в обработке участвуют персональные данные граждан России, первичная база по части 5 статьи 18 закона 152-ФЗ должна находиться на территории страны. Мы не оказываем юридических услуг — схему обработки согласуйте с юристом.
Модель совместима с распространенными движками вывода — Transformers, vLLM, SGLang, KTransformers, а также запускается через библиотеку Ollama. Аренда серверов с видеокартами начинается от 7000 в месяц, доступна почасовая оплата: удобно замерить модель на реальной нагрузке до перехода на месячный тариф. Подобрать конфигурацию можно в разделе аренды GPU-серверов.