Дата публикации
ai_products

Alibaba показала Qwen3.6-Max-Preview — более «умный» ИИ для кода и агентов

Что нового

Alibaba представила раннюю версию следующей флагманской модели — Qwen3.6-Max-Preview. Это преемник Qwen3.6-Plus с упором на программирование и работу в роли агента.

По сравнению с Qwen3.6-Plus, Qwen3.6-Max-Preview даёт прирост по ряду бенчмарков:

  • Агентное программирование и код:
    • SkillsBench: +9,9 пункта
    • SciCode: +6,3
    • NL2Repo: +5,0
    • Terminal-Bench 2.0: +3,8
  • Мировые знания:
    • SuperGPQA: +2,3
    • QwenChineseBench: +5,3
  • Следование инструкциям:
    • ToolcallFormatIFBench: +2,8

Alibaba отдельно подчёркивает, что Qwen3.6-Max-Preview:

  • занимает первое место на шести крупных кодовых бенчмарках:
    • SWE-bench Pro
    • Terminal-Bench 2.0
    • SkillsBench
    • QwenClawBench
    • QwenWebBench
    • SciCode
  • лучше справляется с задачами на знания (SuperGPQA, QwenChineseBench)
  • точнее следует форматам вызова инструментов (ToolcallFormatIFBench)

Модель уже доступна:

  • как облачный сервис в Alibaba Cloud Model Studio под именем qwen3.6-max-preview
  • для интерактивного общения в Qwen Studio

Дополнительно в API появился режим preserve_thinking, который сохраняет «мышление» модели между запросами. Это важно для сложных многошаговых агентов.

Как это работает

Qwen3.6-Max-Preview — это закрытая облачная модель Alibaba, к которой можно обратиться через:

  • Qwen Studio — веб-интерфейс для чата
  • Alibaba Cloud Model Studio API — совместимый по протоколу с OpenAI и Anthropic

Под капотом несколько ключевых технических идей, которые видны по описанию API:

  1. Режим "thinking"

    • Параметр enable_thinking: True включает генерацию отдельного потока «размышлений» модели.
    • Эти размышления приходят в поле reasoning_content в стриминговом ответе.
    • Основной ответ для пользователя идёт в поле content.
    • Это позволяет разделить внутреннюю цепочку рассуждений и финальный текст.
  2. preserve_thinking для агентов

    • Параметр preserve_thinking: True (в примере закомментирован, но поддерживается) сохраняет всё предыдущее «мышление» в истории сообщений.
    • Это важно для агентных сценариев, где модель шаг за шагом строит план, пишет код, вызывает инструменты и должна помнить, как она к этому пришла.
  3. Совместимость с существующими клиентами

    • Alibaba использует OpenAI-совместимый интерфейс: тот же метод chat.completions.create, те же структуры messages, delta, usage.
    • Есть и Anthropic-совместимый API-интерфейс (без примеров в тексте, но Alibaba прямо это заявляет).
    • Это упрощает миграцию: можно использовать те же SDK, что и для GPT-4o или Claude 3.5, просто сменив base_url и имя модели.
  4. Географически распределённые эндпоинты

    • Для "совместимого режима" указаны три базовых URL:
      • Пекин: https://dashscope.aliyuncs.com/compatible-mode/v1
      • Сингапур: https://dashscope-intl.aliyuncs.com/compatible-mode/v1
      • США (Вирджиния): https://dashscope-us.aliyuncs.com/compatible-mode/v1
    • Это снижает задержки для разных регионов и помогает с соблюдением локальных требований.
  5. Фокус на кодовых бенчмарках

    • Наборы SWE-bench Pro, Terminal-Bench 2.0, SkillsBench, QwenClawBench, QwenWebBench, SciCode проверяют разные аспекты разработки:
      • правки реальных репозиториев
      • работа в терминале
      • взаимодействие с вебом
      • написание и отладка научного кода
    • Лидирующие результаты на этих тестах говорят о том, что Qwen3.6-Max-Preview оптимизировали именно под такие сценарии.

Модель пока в статусе preview. Alibaba прямо говорит, что продолжит итерации и ожидает дальнейший рост качества в следующих версиях.

Что это значит для вас

Для разработчиков и ML-инженеров

Qwen3.6-Max-Preview стоит попробовать, если вы:

  • строите агентов для разработки:
    • автогенерация и правка кода
    • работа с терминалом
    • взаимодействие с репозиториями (NL2Repo)
    • полуавтоматическое решение задач из issue-трекеров
  • делаете веб- или системных агентов:
    • выполнение многошаговых сценариев
    • комбинирование вызовов инструментов
    • поддержка сложных инструкций и форматов (ToolcallFormatIFBench)
  • работаете с китайским языком и мультиязычными задачами:
    • рост на +5,3 на QwenChineseBench и улучшения на SuperGPQA говорят о более надёжной работе с фактами

Где Qwen3.6-Max-Preview особенно полезен:

  • Кодовые ассистенты и IDE-плагины
    • генерация функций и классов
    • рефакторинг
    • написание тестов
    • объяснение чужого кода
  • Автофиксы багов по тестам и логам
    • бенчмарки вроде SWE-bench Pro и SciCode как раз об этом
  • Агенты, которые живут дольше одного запроса
    • планирование, выполнение, анализ результатов, повторные шаги
    • здесь помогает preserve_thinking

Где лучше быть осторожнее:

  • Критичные юридические и медицинские решения
    • в описании нет гарантий по этим областям
    • модель ориентирована на код и общие знания, а не на сертифицированные доменные ответы
  • Полная автономия без контроля человека
    • даже с сильными результатами на бенчмарках агенты по-прежнему ошибаются
    • нужен человек в цикле, особенно там, где ошибки стоят дорого

Вопрос доступности из России

Qwen3.6-Max-Preview работает через Alibaba Cloud Model Studio и Qwen Studio. Для доступа может понадобиться:

  • учётная запись Alibaba Cloud
  • выбор подходящего региона (Пекин, Сингапур, США)

При подключении из России возможны ограничения по платежам и доступу к зарубежным облакам. В ряде случаев понадобится VPN и платёжный инструмент, который принимает Alibaba Cloud.

Если вы уже пользуетесь Alibaba Cloud для инфраструктуры, подключить Qwen3.6-Max-Preview будет проще — всё в одной экосистеме.

Место на рынке

Alibaba напрямую сравнивает Qwen3.6-Max-Preview только с Qwen3.6-Plus — и даёт численные приросты по бенчмаркам. В тексте нет прямых сравнений с GPT-4o, Claude 3.5 или другими конкретными моделями.

Из того, что есть:

  • Qwen3.6-Max-Preview — следующий проприетарный флагман в линейке Qwen.
  • Модель показывает топовые результаты на шести крупных кодовых тестах:
    • SWE-bench Pro
    • Terminal-Bench 2.0
    • SkillsBench
    • QwenClawBench
    • QwenWebBench
    • SciCode
  • По сравнению с Qwen3.6-Plus модель стала сильнее:
    • в программировании и агентном коде (SkillsBench +9,9; SciCode +6,3; NL2Repo +5,0; Terminal-Bench 2.0 +3,8)
    • в знаниях (SuperGPQA +2,3; QwenChineseBench +5,3)
    • в следовании формальным инструкциям (ToolcallFormatIFBench +2,8)

Alibaba делает ставку на совместимость API с OpenAI и Anthropic. Это важный аргумент для команд, которые хотят протестировать альтернативу без переписывания всего кода клиента.

Если вы уже используете Qwen3.6-Plus, логика простая:

  • для задач кода и агентов имеет смысл мигрировать на qwen3.6-max-preview, чтобы получить ощутимый прирост по бенчмаркам;
  • для простых чат-ботов без тяжёлой логики можно остаться на Plus, если вас устраивает качество и стоимость.

Как запустить

1. Переменные окружения

Alibaba предлагает настроить окружение через переменные:

""" Environment variables (per official docs):
DASHSCOPE_API_KEY: Your API Key from https://modelstudio.console.alibabacloud.com
DASHSCOPE_BASE_URL: (optional) Base URL for compatible-mode API.
- Beijing: https://dashscope.aliyuncs.com/compatible-mode/v1
- Singapore: https://dashscope-intl.aliyuncs.com/compatible-mode/v1
- US (Virginia): https://dashscope-us.aliyuncs.com/compatible-mode/v1
DASHSCOPE_MODEL: (optional) Model name; override for different models.
"""

Главное:

  • получите API-ключ в консоли Model Studio
  • задайте DASHSCOPE_API_KEY
  • при необходимости выберите регион через DASHSCOPE_BASE_URL
  • по умолчанию будет использоваться qwen3.6-max-preview

2. Пример кода для chat completions (Python)

Alibaba показывает полный пример на Python с использованием клиента openai:

from openai import OpenAI
import os

api_key = os.environ.get("DASHSCOPE_API_KEY")
if not api_key:
    raise ValueError(
        "DASHSCOPE_API_KEY is required. "
        "Set it via: export DASHSCOPE_API_KEY='your-api-key'"
    )

client = OpenAI(
    api_key=api_key,
    base_url=os.environ.get(
        "DASHSCOPE_BASE_URL",
        "https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
    ),
)

messages = [{"role": "user", "content": "Introduce vibe coding."}]

model = os.environ.get(
    "DASHSCOPE_MODEL",
    "qwen3.6-max-preview",
)

completion = client.chat.completions.create(
    model=model,
    messages=messages,
    extra_body={
        "enable_thinking": True,
        # "preserve_thinking": True,
    },
    stream=True
)

reasoning_content = ""  # Full reasoning trace
answer_content = ""      # Full response
is_answering = False      # Whether we have entered the answer phase

print("\n" + "=" * 20 + "Reasoning" + "=" * 20 + "\n")

for chunk in completion:
    if not chunk.choices:
        print("\nUsage:")
        print(chunk.usage)
        continue

    delta = chunk.choices[0].delta

    # Collect reasoning content only
    if hasattr(delta, "reasoning_content") and delta.reasoning_content is not None:
        if not is_answering:
            print(delta.reasoning_content, end="", flush=True)
        reasoning_content += delta.reasoning_content

    # Received content, start answer phase
    if hasattr(delta, "content") and delta.content:
        if not is_answering:
            print("\n" + "=" * 20 + "Answer" + "=" * 20 + "\n")
            is_answering = True
        print(delta.content, end="", flush=True)
        answer_content += delta.content

Что важно в этом примере:

  • используется стриминг (stream=True), поэтому ответ приходит по частям
  • "мышление" модели печатается в блоке Reasoning, основной ответ — в блоке Answer
  • enable_thinking включён, preserve_thinking показан как опция для агентных сценариев

3. Где посмотреть документацию

Alibaba предлагает перейти к документации API через ссылку в Model Studio. Там можно найти:

  • описание всех параметров extra_body
  • примеры для других языков
  • детали Anthropic-совместимого интерфейса

Если вы уже работали с OpenAI-клиентом, переход займёт минимум времени: структура запросов и ответов знакома, меняются только ключ и URL.


Qwen3.6-Max-Preview — это ранний, но уже довольно агрессивный шаг Alibaba в сторону сильных кодовых и агентных моделей. Если вы строите инструменты для разработчиков, стоит заложить время на тесты: бенчмарки обещают заметный выигрыш по сравнению с Qwen3.6-Plus.


Читайте также