Apps post
← К списку постов

Qwen3-Coder-Next: мощная open-source модель от Alibaba с 10x ростом производительности для работы с репозиториями

Опубликовано: 20 февраля 2026 г. в 04:37

Источник: Apps-лента этого сайта.

Alibaba выпустила Qwen3-Coder-Next — специализированную open-source модель на 80 млрд параметров с ультраразреженной архитектурой MoE, которая обеспечивает в 10 раз более высокую пропускную способность по сравнению с плотными моделями аналогичного размера при работе с репозиториями.

Что такое Qwen3-Coder-Next?

Команда Qwen из Alibaba — один из мировых лидеров в open-source разработке ИИ — представила новую модель, которая создана специально для «vibe coders» и агентного программирования. Модель выпущена под лицензией Apache 2.0, что разрешает коммерческое использование как крупными компаниями, так и независимыми разработчиками. Веса модели доступны на Hugging Face в четырёх вариантах.

Ультраразреженная архитектура MoE: меньше — значит быстрее

Несмотря на то что модель содержит 80 миллиардов параметров в совокупности, во время обработки каждого токена активируется лишь 3 миллиарда параметров. Это достигается за счёт архитектуры Mixture-of-Experts (MoE) с 512 экспертами, из которых одновременно задействуются 10.

Такой подход позволяет модели:

  • обеспечивать качество рассуждений, сопоставимое с массивными проприетарными системами;
  • сохранять низкие затраты на развёртывание и высокую скорость вывода;
  • работать локально на потребительском железе — Mac с 64 ГБ RAM или GPU RTX 5090 — со скоростью 20–40 токенов/с.

Решение проблемы длинного контекста

Ключевое техническое нововведение — гибридная архитектура Gated DeltaNet + Gated Attention, разработанная для преодоления квадратичного масштабирования стандартных трансформеров при росте контекстного окна.

Gated DeltaNet выступает линейной альтернативой стандартному softmax-вниманию, позволяя модели поддерживать состояние в окне из 262 144 токенов без экспоненциального роста задержки. В сочетании с ультраразреженным MoE это даёт теоретический прирост пропускной способности в 10 раз по сравнению с плотными моделями аналогичной ёмкости.

Для предотвращения галлюцинаций при работе с длинным контекстом во время обучения применялась стратегия Best-Fit Packing (BFP), исключающая ошибки усечения документов.

Агентное обучение: 800 000 верифицируемых задач

«Next» в названии модели отражает фундаментальный сдвиг в методологии обучения. В отличие от традиционных подходов, основанных на статических парах «код — текст», Qwen3-Coder-Next обучалась через масштабный агентный пайплайн:

  • 800 000 верифицируемых задач — реальные сценарии исправления багов из GitHub pull request’ов с полностью исполняемыми окружениями;
  • Система оркестрации MegaFlow на базе Alibaba Cloud Kubernetes — каждая задача проходит три стадии: rollout агента, оценка и постобработка;
  • Обучение с подкреплением в реальном времени — если код не проходит юнит-тест или ломает контейнер, модель получает немедленную обратную связь и учится на ошибках.

Специализированные эксперты и поддержка 370 языков

Вместо единой «модели-дженералиста» команда разработала специализированных экспертов, знания которых затем дистиллировались в основную модель:

  • Web Development Expert — для full-stack задач: построение UI, композиция компонентов; все образцы рендерились в Chromium через Playwright, а качество страниц оценивалось Vision-Language Model;
  • User Experience Expert — оптимизирован для форматов вызова инструментов в различных CLI/IDE-окружениях (Cline, OpenCode).

Дополнительные характеристики продукта:

  • Поддержка 370 языков программирования (в предыдущих версиях было 92);
  • Новый формат XML-Style Tool Calling (qwen3_coder), позволяющий передавать длинные фрагменты кода без накладных расходов JSON;
  • Среднее обучение на ~600 млрд токенов данных уровня репозитория — для лучшего понимания межфайловых зависимостей.

Бенчмарки: конкурирует с проприетарными гигантами

Результаты на ключевых отраслевых бенчмарках (скаффолд SWE-Agent) подтверждают конкурентоспособность модели:

  • SWE-Bench Verified: 70.6% — опережает DeepSeek-V3.2 (70.2%), уступая лишь GLM-4.7 (74.2%);
  • SecCodeBench (безопасность кода): 61.2% против 52.5% у Claude Opus 4.5;
  • CWEval (многоязычная безопасность): func-sec@1 = 56.32% — превышает показатели DeepSeek-V3.2 и GLM-4.7.

Примечательно, что высокие показатели безопасности модель демонстрирует даже без явных подсказок, что свидетельствует о выработанной способности самостоятельно предвосхищать типичные уязвимости.

Итог

Qwen3-Coder-Next представляет собой наиболее серьёзный вызов доминированию закрытых моделей для программирования в 2026 году. Модель доказывает, что всего 3 миллиарда активных параметров достаточно для решения сложных задач реального инженерного проекта — при условии правильной архитектуры и подхода к обучению.

По словам команды Qwen: «Масштабирование агентного обучения, а не только размера модели — ключевой драйвер для продвижения возможностей реального агента по написанию кода». Эра «моделей-мамонтов» может уступить место ультрабыстрым экспертам, способным мыслить глубоко и работать стремительно.