Gemma4:26b — это бесплатная LLM-модель для AI-агентных нагрузок, разработки и цепочек рассуждений.
Gemma4:26b предустановлена на серверах в Нидерландах, Финляндии, Германии, Исландии, США, Турции, Польше, Англии, Франции, Испании, Швейцарии и России.
Арендуйте виртуальный (VPS) или выделенный сервер с Gemma4:26b — бесплатной LLM-моделью для для AI-агентных нагрузок, разработки и сложных цепочек рассуждений. Выберите Gemma4:26b, сконфигурируйте сервер и приступите к работе уже через 15 минут.
Gemma4:26b предоставляется только для арендованных серверов HOSTKEY. Для автоматической установкиGemma4:26b выберите это ПО во вкладке «Маркетплейс приложений» при заказе услуги.
Арендуйте надежный VPS в Европе, США и Турции.
Готовность: ≈15 минут.
Арендуйте выделенный сервер в Европе, США и Турции.
Готовность: ≈15 минут.
Gemma 4:26b (Gemma 4 26B A4B Mixture-of-Experts) распространяется согласно лицензии Apache 2.0, что делает ее бесплатной для личного, учебного и коммерческого использования.
Мы гарантируем, что на сервере установлено безопасное оригинальное программное обеспечение.
Чтобы установить Gemma4:26b, нужно выбрать это приложение во время заказа сервера на сайте HOSTKEY. Наша система автоматического деплоя произведет установку программного обеспечения на ваш сервер.
Если у вас возникли вопросы или затруднения при использовании Gemma4:26b, внимательно изучите документацию на официальном сайте разработчика или обратитесь в официальную службу поддержки.
Gemma 4 26B (26B-A4B) — это большая открытая языковая LLM-модель, построенная на архитектуре Mixture-of-Experts (MoE). При общем объеме в 26 миллиардов параметров, она задействует всего около 4 миллиардов активных параметров на токен, обеспечивая высокую скорость работы и эффективность на локальном железе.
Gemma 4 26B A4B — открытая модель Google DeepMind, вышедшая 2 апреля 2026 года. В ней 25,2 млрд параметров, но на каждый токен работают только около 4 млрд: это архитектура со смесью экспертов, поэтому модель считает почти со скоростью четырехмиллиардной, а отвечает заметно лучше. Контекст — 256 тысяч токенов, поддерживается ввод текста, изображений и видео, лицензия Apache 2.0 разрешает коммерческое использование. Запускается на арендованном сервере с видеокартой, данные при этом никуда не уходят.
Gemma 4 вышла в четырех размерах: E2B и E4B для устройств, 26B A4B со смесью экспертов и 31B с плотной архитектурой. Обозначение A4B в названии означает количество активных параметров — примерно 4 млрд из 25,2 млрд общих.
|
Параметр |
Значение |
|
Разработчик |
Google DeepMind |
|
Дата выхода |
2 апреля 2026 |
|
Всего параметров |
25,2 млрд |
|
Активных на токен |
около 4 млрд |
|
Архитектура |
смесь экспертов (MoE) |
|
Контекстное окно |
256 тысяч токенов |
|
Максимальный вывод |
32 768 токенов |
|
Языки |
более 140 |
|
Лицензия |
Apache 2.0 |
По независимым замерам качества версия на 26B заняла шестое место в текстовом рейтинге Arena, плотная версия на 31B — третье. Подробное описание архитектуры и вариантов выложено в карточке модели на Hugging Face.
В модели со смесью экспертов слои разделены на группы, и на каждый токен маршрутизатор выбирает лишь малую часть из них. Считается только выбранная часть, остальные веса в этот момент не участвуют.
Отсюда два практических следствия, и они тянут в разные стороны.
Получается, что экономия идет по вычислениям, а не по памяти. Планировать конфигурацию сервера нужно от полного размера модели, а не от активной части — это самая частая ошибка при первом развертывании.
Дополнительно архитектура использует гибридное внимание: слои с окном скользящего внимания чередуются с полными глобальными, причем последний слой всегда глобальный. Это снижает расход памяти на длинном контексте без потери связности.
Расчет строится от 25,2 млрд параметров и разрядности весов. Приведенные цифры — ориентиры под сами веса, без учета кеша внимания.
|
Разрядность |
Вес модели |
С запасом на работу |
Подходящие карты |
|
16 бит |
около 50 ГБ |
от 56 ГБ |
две карты или одна на 80 ГБ |
|
8 бит |
около 25 ГБ |
от 30 ГБ |
RTX A6000 48 ГБ, RTX 5090 32 ГБ |
|
4 бита |
около 13 ГБ |
от 16 ГБ |
RTX A5000 24 ГБ комфортно, RTX A4000 16 ГБ впритык |
Практическая рекомендация: начинайте с восьмибитного квантования. Оно дает качество, близкое к исходному, и помещается в одну карту — например, в сервер с RTX 5090. Четырехбитное подходит, когда важнее цена, а не точность формулировок.
Заявленные 256 тысяч токенов — это потолок модели, а не то, что автоматически поместится в вашу карту. Кеш ключей и значений растет вместе с длиной контекста и на максимальной длине занимает десятки гигабайт сверх весов.
Что с этим делают на практике:
Ориентир для планирования: под задачи вроде обработки обращений или ответов по базе знаний хватает 16–32 тысяч токенов. Полные 256 тысяч нужны при разборе больших документов целиком.
Аудиовход в этой версии не поддерживается: он есть только у младших моделей семейства, E2B и E4B. Полный список версий и дат выхода Google ведет в журнале релизов Gemma.
Gemma 4 — первая в линейке, вышедшая под Apache 2.0. Предыдущие версии распространялись по собственным условиям Google с политикой запрещенного использования, и юридические службы компаний регулярно тормозили внедрение из-за размытости формулировок.
Apache 2.0 снимает этот вопрос: лицензия разрешает коммерческое использование, изменение и распространение производных моделей, включая дообученные под вашу задачу. Для компаний, которым нужно согласование от юристов, это часто решающий аргумент в пользу Gemma по сравнению с моделями на собственных лицензиях.
Открытые веса имеют смысл ровно тогда, когда важен хотя бы один из четырех пунктов.
|
Что решает |
Свой сервер |
Внешний API |
|
Куда уходят данные |
никуда, обработка на вашей машине |
к поставщику услуги |
|
Стоимость при постоянной нагрузке |
фиксированная аренда |
растет с числом запросов |
|
Задержка |
определяется вашей сетью |
плюс обращение к внешнему сервису |
|
Дообучение под свою задачу |
доступно |
ограничено возможностями поставщика |
Отдельный довод для российских компаний: если в запросах есть персональные данные граждан России, первичная база должна находиться на территории страны по части 5 статьи 18 закона 152-ФЗ. Свой сервер на московской площадке этот вопрос закрывает. Мы не оказываем юридических услуг — схему обработки стоит согласовать с юристом.
Аренда серверов с видеокартами начинается от 7500 рублей в месяц, доступна почасовая оплата — удобно, чтобы сначала замерить модель на реальной нагрузке, а потом переходить на месячный тариф. Подобрать конфигурацию можно в разделе аренды GPU-серверов. Для научных проектов и участников соревнований по анализу данных действует отдельная программа грантов на бесплатные серверы с видеокартами.