> · · 5 мин

AMD Ryzen AI Halo — 128 ГБ под локальные LLM за $3,999. Главный подвох: этому чипу больше года

AMD Ryzen AI Halo — 128 ГБ под локальные LLM за $3,999. Главный подвох: этому чипу больше года

LTT Labs разобрали до винтика новый мини-ПК AMD, вплоть до CT-скана системы охлаждения, и обзор вчера висел в топе Hacker News. Повод присмотреться есть: с 10 июля Halo появляется в американской рознице, и это самый компактный способ получить 128 ГБ unified-памяти под локальные модели в готовой, преднастроенной коробке.

TL;DR: Ryzen AI Halo — мини-ПК 15×15×4 см за $3,999: Ryzen AI Max+ 395, 128 ГБ LPDDR5x, 2 ТБ SSD, Windows или Linux с настроенным AI-стеком. Дешевле DGX Spark на $700-800. Подвох: чип продаётся с весны 2025-го, а пропускная способность памяти втрое ниже, чем у Mac Studio.

Что внутри за $3,999?

Внутри Ryzen AI Max+ 395 (кодовое имя Strix Halo): 16 ядер Zen 5 до 5.1 ГГц, встроенная Radeon 8060S на 40 CU (60 FP16 TFLOPS), NPU XDNA 2 на 50 TOPS и 128 ГБ LPDDR5x-8000 общей памяти, из которых GPU может адресовать до 96 ГБ. Плюс 2 ТБ SSD (обычный M.2 2280, меняется без разборки корпуса), 10GbE, Wi-Fi 7. Корпус 149×149×43 мм, TDP процессора 120 Вт, питание по USB-C EPR на 240 Вт — LTT проверили переговоры Power Delivery анализатором: коробка честно запрашивает 48 В.

Продаётся в двух вариантах, с Windows 11 Pro или Linux, по одной цене. Эксклюзив Micro Center, самовывоз, в наличии ориентировочно с 10 июля.

Зачем он, если чип старый?

Кремний действительно не новость: Max+ 395 живёт в ноутбуках и Framework Desktop с весны 2025-го, и LTT прямо пишут, что по железу Halo ничего нового не предлагает. AMD продаёт не транзисторы, а «batteries included»: предустановленные Best Known Configurations (выверенные связки драйверов, рантаймов и моделей), AI Playbooks с пошаговыми сценариями от llama.cpp до ComfyUI и Developer Center, который держит весь этот зоопарк в актуальном состоянии. Обещание «от розетки до токенов за минуты» — прямая шпилька в сторону ROCm-квестов прошлых лет, которые AMD сама же и породила.

Экономика в изложении AMD: если тратишь около $773 в месяц на облачные токены (примерно 6 млн в день), коробка окупается за полгода. Расчёт вендорский и предполагает идеальную утилизацию, но порядок величин здравый.

Как Halo выглядит против DGX Spark и Mac Studio?

  • NVIDIA DGX Spark — в рознице сейчас $4,699-4,799 (стартовал с $3,999): ARM-чип GB10, те же 128 ГБ, только Linux. Зато CUDA-экосистема и ConnectX, чтобы спарить два бокса под модели до 405B. Halo дешевле и живёт на x86 с нормальной Windows, Spark — путь наименьшего сопротивления для всего, что написано под NVIDIA.
  • Mac Studio M3 Ultra — до 512 ГБ unified и около 819 ГБ/с пропускной способности против ~256 ГБ/с у Halo. В тестах LTT на MoE-моделях (Qwen 3.6 35B A3B, GLM 4.7 Flash) Маки уходят вперёд именно за счёт памяти. Но Mac с 512 ГБ стоит как три Halo.
  • Framework Desktop — тот же самый Max+ 395. По подсчётам Phoronix, аналогичная комплектация со 128 ГБ выходит в $3,983, то есть ту же цену, но в формате конструктора без готового AI-стека.

Сколько токенов в секунду он реально выдаёт?

Коротко: для моделей класса 20-30B и MoE с небольшим числом активных параметров хватает, но контекст — больное место. LTT показали, что у всех трёх протестированных моделей скорость заметно проседает по мере роста контекста, а Gemma 4 на Vulkan-бэкенде с контекстом 65K вообще не завершила прогон за полчаса. Для агентских сценариев, где контекст пухнет от тул-коллов, эта кривая деградации важнее пиковых цифр из маркетинга.

Отдельный сюжет — NPU. Через AMD-овский Lemonade модель gpt-oss-20b крутится на 20 ток/с при 35 Вт потребления всего пакета, CPU и GPU при этом свободны для другой работы. Красиво, но телеметрии NPU нет: насколько он загружен, LTT определяли по ваттметру.

Подводные камни

  • Пропускная способность памяти — жёсткий потолок. 256 ГБ/с против 819 у M3 Ultra: большие MoE и длинные контексты упираются в неё, и никакой софт это не лечит.
  • Заводские образы ОС AMD не отдаёт. Систему можно снести и поставить свою, устройство не залочено. Но вернуть кураторский сетап или переключиться между фирменными Linux и Windows «как с завода» не выйдет — образов в открытом доступе нет, LTT это проверяли.
  • Только Micro Center, только США, только самовывоз. Онлайн-доставки нет даже для американцев. Для покупателя из России это означает перекупов и наценку сверху.
  • Q3 принесёт Max+ Pro 495 со 192 ГБ. AMD уже анонсировала следующую версию платформы с поддержкой моделей до 300B параметров. Купить сейчас — значит через квартал смотреть на устаревшую конфигурацию.

Вердикт

Бери, если нужен готовый x86-бокс со 128 ГБ, выбором между Windows и Linux и настроенным стеком, а возиться с драйверами не хочется: против Spark это честные $700-800 экономии. Не бери, если основная нагрузка — большие MoE и длинные контексты: Mac Studio с его пропускной способностью быстрее, а CUDA-зависимым дорога к Spark. Умеешь собирать сам — Framework Desktop даёт то же железо за те же деньги. И если 128 ГБ уже впритык, подожди 192-гиговую версию в Q3.

Как попробовать

  1. Полный обзор LTT Labs с методикой и CT-сканом: lttlabs.com
  2. Резерв — через страницу AMD, оттуда ссылка на Micro Center.
  3. Кривую деградации по контексту можно снять на любом железе: llama-bench -m <model> -p 512 -n 64 -fa 1 -ngl 999 -d 0,4096,16384,65536 — и сравнить с графиками LTT.
  4. Плейбуки AMD для быстрого старта: developer.amd.com/playbooks
$ ls ./related/

Похожие статьи

toktier-tokenization-ttft.md
Токенизация съедает до 64% времени до первого токена. Не инференс, а токенизация
> · 8 мин

Токенизация съедает до 64% времени до первого токена. Не инференс, а токенизация

У кодинг-агентов промпт-кеш попадает в 94,1% случаев, и на этом фоне токенизация вырастает с 10% до 64% времени до первого токена: фронтенд каждый раз токенизирует весь транскрипт заново. TokTier делает её stateful, переклеивая только окно вокруг дописанного куска: до 437 раз быстрее токенизатора Hugging Face и минус 16 до 34% медианного TTFT с vLLM.

ai llm inference vllm
codex-cli-147-skills-import.md
Codex CLI 0.147 забирает скиллы прямо из Cursor и умеет сам себе одобрять команды. В том же релизе ужесточают песочницу
> · 7 мин

Codex CLI 0.147 забирает скиллы прямо из Cursor и умеет сам себе одобрять команды. В том же релизе ужесточают песочницу

Codex CLI 0.147.0 импортирует скиллы, которыми управляет Cursor, синхронизирует диалоги Claude и Cursor без дублей и добавляет флаг --approve-for-me с автоматически проверяемыми одобрениями. Плюс поддержка финальной спеки MCP 2026-07-28 и десяток правок песочницы. Команды export наружу по-прежнему нет.

ai cursor agents codex
openai-astra-critical-cyber.md
OpenAI не может исключить, что её будущая модель находит 0-day сама. Часть работ по Astra остановлена
> · 7 мин

OpenAI не может исключить, что её будущая модель находит 0-day сама. Часть работ по Astra остановлена

OpenAI объявила, что предварительные замеры Astra не позволяют исключить уровень Critical по кибербезопасности в её собственном Preparedness Framework. Это первый такой случай: все прежние модели, включая GPT-5.6 Sol, проходили уровнем ниже. Активности, не дотягивающие до усиленных требований, приостановлены, а мониторы теперь читают цепочку размышлений.

ai llm openai security
subscribe.sh

$ cat /dev/blog/updates

> Свежие заметки о программировании,

> DevOps и AI — прямо в мессенджер

./subscribe