- Дата публикации
Alibaba показала Qwen3.6-Max-Preview — более «умный» ИИ для кода и агентов
Что нового
Alibaba представила раннюю версию следующей флагманской модели — Qwen3.6-Max-Preview. Это преемник Qwen3.6-Plus с упором на программирование и работу в роли агента.
По сравнению с Qwen3.6-Plus, Qwen3.6-Max-Preview даёт прирост по ряду бенчмарков:
- Агентное программирование и код:
- SkillsBench: +9,9 пункта
- SciCode: +6,3
- NL2Repo: +5,0
- Terminal-Bench 2.0: +3,8
- Мировые знания:
- SuperGPQA: +2,3
- QwenChineseBench: +5,3
- Следование инструкциям:
- ToolcallFormatIFBench: +2,8
Alibaba отдельно подчёркивает, что Qwen3.6-Max-Preview:
- занимает первое место на шести крупных кодовых бенчмарках:
- SWE-bench Pro
- Terminal-Bench 2.0
- SkillsBench
- QwenClawBench
- QwenWebBench
- SciCode
- лучше справляется с задачами на знания (SuperGPQA, QwenChineseBench)
- точнее следует форматам вызова инструментов (ToolcallFormatIFBench)
Модель уже доступна:
- как облачный сервис в Alibaba Cloud Model Studio под именем
qwen3.6-max-preview - для интерактивного общения в Qwen Studio
Дополнительно в API появился режим preserve_thinking, который сохраняет «мышление» модели между запросами. Это важно для сложных многошаговых агентов.
Как это работает
Qwen3.6-Max-Preview — это закрытая облачная модель Alibaba, к которой можно обратиться через:
- Qwen Studio — веб-интерфейс для чата
- Alibaba Cloud Model Studio API — совместимый по протоколу с OpenAI и Anthropic
Под капотом несколько ключевых технических идей, которые видны по описанию API:
-
Режим "thinking"
- Параметр
enable_thinking: Trueвключает генерацию отдельного потока «размышлений» модели. - Эти размышления приходят в поле
reasoning_contentв стриминговом ответе. - Основной ответ для пользователя идёт в поле
content. - Это позволяет разделить внутреннюю цепочку рассуждений и финальный текст.
- Параметр
-
preserve_thinkingдля агентов- Параметр
preserve_thinking: True(в примере закомментирован, но поддерживается) сохраняет всё предыдущее «мышление» в истории сообщений. - Это важно для агентных сценариев, где модель шаг за шагом строит план, пишет код, вызывает инструменты и должна помнить, как она к этому пришла.
- Параметр
-
Совместимость с существующими клиентами
- Alibaba использует OpenAI-совместимый интерфейс: тот же метод
chat.completions.create, те же структурыmessages,delta,usage. - Есть и Anthropic-совместимый API-интерфейс (без примеров в тексте, но Alibaba прямо это заявляет).
- Это упрощает миграцию: можно использовать те же SDK, что и для GPT-4o или Claude 3.5, просто сменив
base_urlи имя модели.
- Alibaba использует OpenAI-совместимый интерфейс: тот же метод
-
Географически распределённые эндпоинты
- Для "совместимого режима" указаны три базовых URL:
- Пекин:
https://dashscope.aliyuncs.com/compatible-mode/v1 - Сингапур:
https://dashscope-intl.aliyuncs.com/compatible-mode/v1 - США (Вирджиния):
https://dashscope-us.aliyuncs.com/compatible-mode/v1
- Пекин:
- Это снижает задержки для разных регионов и помогает с соблюдением локальных требований.
- Для "совместимого режима" указаны три базовых URL:
-
Фокус на кодовых бенчмарках
- Наборы SWE-bench Pro, Terminal-Bench 2.0, SkillsBench, QwenClawBench, QwenWebBench, SciCode проверяют разные аспекты разработки:
- правки реальных репозиториев
- работа в терминале
- взаимодействие с вебом
- написание и отладка научного кода
- Лидирующие результаты на этих тестах говорят о том, что Qwen3.6-Max-Preview оптимизировали именно под такие сценарии.
- Наборы SWE-bench Pro, Terminal-Bench 2.0, SkillsBench, QwenClawBench, QwenWebBench, SciCode проверяют разные аспекты разработки:
Модель пока в статусе preview. Alibaba прямо говорит, что продолжит итерации и ожидает дальнейший рост качества в следующих версиях.
Что это значит для вас
Для разработчиков и ML-инженеров
Qwen3.6-Max-Preview стоит попробовать, если вы:
- строите агентов для разработки:
- автогенерация и правка кода
- работа с терминалом
- взаимодействие с репозиториями (NL2Repo)
- полуавтоматическое решение задач из issue-трекеров
- делаете веб- или системных агентов:
- выполнение многошаговых сценариев
- комбинирование вызовов инструментов
- поддержка сложных инструкций и форматов (ToolcallFormatIFBench)
- работаете с китайским языком и мультиязычными задачами:
- рост на +5,3 на QwenChineseBench и улучшения на SuperGPQA говорят о более надёжной работе с фактами
Где Qwen3.6-Max-Preview особенно полезен:
- Кодовые ассистенты и IDE-плагины
- генерация функций и классов
- рефакторинг
- написание тестов
- объяснение чужого кода
- Автофиксы багов по тестам и логам
- бенчмарки вроде SWE-bench Pro и SciCode как раз об этом
- Агенты, которые живут дольше одного запроса
- планирование, выполнение, анализ результатов, повторные шаги
- здесь помогает
preserve_thinking
Где лучше быть осторожнее:
- Критичные юридические и медицинские решения
- в описании нет гарантий по этим областям
- модель ориентирована на код и общие знания, а не на сертифицированные доменные ответы
- Полная автономия без контроля человека
- даже с сильными результатами на бенчмарках агенты по-прежнему ошибаются
- нужен человек в цикле, особенно там, где ошибки стоят дорого
Вопрос доступности из России
Qwen3.6-Max-Preview работает через Alibaba Cloud Model Studio и Qwen Studio. Для доступа может понадобиться:
- учётная запись Alibaba Cloud
- выбор подходящего региона (Пекин, Сингапур, США)
При подключении из России возможны ограничения по платежам и доступу к зарубежным облакам. В ряде случаев понадобится VPN и платёжный инструмент, который принимает Alibaba Cloud.
Если вы уже пользуетесь Alibaba Cloud для инфраструктуры, подключить Qwen3.6-Max-Preview будет проще — всё в одной экосистеме.
Место на рынке
Alibaba напрямую сравнивает Qwen3.6-Max-Preview только с Qwen3.6-Plus — и даёт численные приросты по бенчмаркам. В тексте нет прямых сравнений с GPT-4o, Claude 3.5 или другими конкретными моделями.
Из того, что есть:
- Qwen3.6-Max-Preview — следующий проприетарный флагман в линейке Qwen.
- Модель показывает топовые результаты на шести крупных кодовых тестах:
- SWE-bench Pro
- Terminal-Bench 2.0
- SkillsBench
- QwenClawBench
- QwenWebBench
- SciCode
- По сравнению с Qwen3.6-Plus модель стала сильнее:
- в программировании и агентном коде (SkillsBench +9,9; SciCode +6,3; NL2Repo +5,0; Terminal-Bench 2.0 +3,8)
- в знаниях (SuperGPQA +2,3; QwenChineseBench +5,3)
- в следовании формальным инструкциям (ToolcallFormatIFBench +2,8)
Alibaba делает ставку на совместимость API с OpenAI и Anthropic. Это важный аргумент для команд, которые хотят протестировать альтернативу без переписывания всего кода клиента.
Если вы уже используете Qwen3.6-Plus, логика простая:
- для задач кода и агентов имеет смысл мигрировать на
qwen3.6-max-preview, чтобы получить ощутимый прирост по бенчмаркам; - для простых чат-ботов без тяжёлой логики можно остаться на Plus, если вас устраивает качество и стоимость.
Как запустить
1. Переменные окружения
Alibaba предлагает настроить окружение через переменные:
""" Environment variables (per official docs):
DASHSCOPE_API_KEY: Your API Key from https://modelstudio.console.alibabacloud.com
DASHSCOPE_BASE_URL: (optional) Base URL for compatible-mode API.
- Beijing: https://dashscope.aliyuncs.com/compatible-mode/v1
- Singapore: https://dashscope-intl.aliyuncs.com/compatible-mode/v1
- US (Virginia): https://dashscope-us.aliyuncs.com/compatible-mode/v1
DASHSCOPE_MODEL: (optional) Model name; override for different models.
"""
Главное:
- получите API-ключ в консоли Model Studio
- задайте
DASHSCOPE_API_KEY - при необходимости выберите регион через
DASHSCOPE_BASE_URL - по умолчанию будет использоваться
qwen3.6-max-preview
2. Пример кода для chat completions (Python)
Alibaba показывает полный пример на Python с использованием клиента openai:
from openai import OpenAI
import os
api_key = os.environ.get("DASHSCOPE_API_KEY")
if not api_key:
raise ValueError(
"DASHSCOPE_API_KEY is required. "
"Set it via: export DASHSCOPE_API_KEY='your-api-key'"
)
client = OpenAI(
api_key=api_key,
base_url=os.environ.get(
"DASHSCOPE_BASE_URL",
"https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
),
)
messages = [{"role": "user", "content": "Introduce vibe coding."}]
model = os.environ.get(
"DASHSCOPE_MODEL",
"qwen3.6-max-preview",
)
completion = client.chat.completions.create(
model=model,
messages=messages,
extra_body={
"enable_thinking": True,
# "preserve_thinking": True,
},
stream=True
)
reasoning_content = "" # Full reasoning trace
answer_content = "" # Full response
is_answering = False # Whether we have entered the answer phase
print("\n" + "=" * 20 + "Reasoning" + "=" * 20 + "\n")
for chunk in completion:
if not chunk.choices:
print("\nUsage:")
print(chunk.usage)
continue
delta = chunk.choices[0].delta
# Collect reasoning content only
if hasattr(delta, "reasoning_content") and delta.reasoning_content is not None:
if not is_answering:
print(delta.reasoning_content, end="", flush=True)
reasoning_content += delta.reasoning_content
# Received content, start answer phase
if hasattr(delta, "content") and delta.content:
if not is_answering:
print("\n" + "=" * 20 + "Answer" + "=" * 20 + "\n")
is_answering = True
print(delta.content, end="", flush=True)
answer_content += delta.content
Что важно в этом примере:
- используется стриминг (
stream=True), поэтому ответ приходит по частям - "мышление" модели печатается в блоке
Reasoning, основной ответ — в блокеAnswer enable_thinkingвключён,preserve_thinkingпоказан как опция для агентных сценариев
3. Где посмотреть документацию
Alibaba предлагает перейти к документации API через ссылку в Model Studio. Там можно найти:
- описание всех параметров
extra_body - примеры для других языков
- детали Anthropic-совместимого интерфейса
Если вы уже работали с OpenAI-клиентом, переход займёт минимум времени: структура запросов и ответов знакома, меняются только ключ и URL.
Qwen3.6-Max-Preview — это ранний, но уже довольно агрессивный шаг Alibaba в сторону сильных кодовых и агентных моделей. Если вы строите инструменты для разработчиков, стоит заложить время на тесты: бенчмарки обещают заметный выигрыш по сравнению с Qwen3.6-Plus.