Зараз читаютьПрактичні новини про код, AI та технології — без інформаційного шуму
AI3 хв читання

Transformers 5.16.1 додала мультимодальну GLM-5.3-Flash

Hugging Face додала підтримку 320-мільярдної MoE-моделі GLM-5.3-Flash, відновила сумісність tensor-parallel API та зафіксувала kernel ESMFold2.

Transformers 5.16.1 додала мультимодальну GLM-5.3-Flash

Hugging Face Transformers 5.16.1 додав підтримку GLM-5.3-Flash — першої нативно мультимодальної моделі в лінійці GLM-5 — і водночас виправив зворотну сумісність tensor-parallel API та зафіксував версію зовнішнього ядра для ESMFold2. Формально це точковий реліз із 16 комітів, але для команд, які експериментують із великими MoE-моделями, він додає нову архітектуру до стандартного Python-стека.

Редакційна ілюстрація мультимодальних потоків, що сходяться у розрідженій нейронній мережі
Редакційна AI-ілюстрація до огляду Transformers 5.16.1; вона не входить до першоджерела й не є схемою GLM.

Що відомо про GLM-5.3-Flash

У release notes модель описано як систему на 320 мільярдів загальних параметрів, з яких для одного проходу активуються приблизно 18 мільярдів. Це типовий сенс Mixture-of-Experts: велика сукупна місткість поєднується з вибірковим запуском частини експертів. За заявою розробників моделі, GLM-5.3-Flash перевершує GLM-5.2 у тестах і робочих навантаженнях, працюючи дешевше, але ці порівняння потрібно перевіряти за первинними таблицями, методикою та власними сценаріями.

Архітектура комбінує sparse attention і linear attention. Розріджена увага зменшує кількість взаємодій між токенами, а лінійні механізми намагаються уникнути квадратичного зростання вартості на довгому контексті. Додатково використано Manifold-Constrained Hyper-Connections, які автори позиціонують як засіб стабільнішого масштабування. Transformers 5.16.1 додає програмну підтримку цієї конфігурації, але сама бібліотека не робить модель дешевою без відповідного runtime, квантування й достатнього обсягу пам’яті.

Мультимодальність у звичному API

Нативна мультимодальність означає, що модель проєктувалася для спільної роботи з кількома типами сигналів, а не отримала окремий візуальний адаптер наприкінці. Для прикладного розробника головна цінність підтримки в Transformers — однакові механізми завантаження конфігурації, процесора й ваг, інтеграція з generation API та знайомий шлях до Accelerate, quantization backends і серверів інференсу.

Однак сумісний клас моделі ще не гарантує, що всі режими працюють однаково. Потрібно окремо перевірити batching різних модальностей, максимальні розміри зображень, шаблон чату, streaming, tool use та поведінку при нестачі VRAM. У великих MoE-моделях вузьким місцем часто стає не арифметика активних параметрів, а зберігання всіх ваг і обмін між пристроями.

Два невеликі, але практичні виправлення

Команда відновила попередню поведінку tensor-parallel API. Такі виправлення особливо важливі в patch-релізі: код, який розподіляє модель між кількома прискорювачами, не повинен непомітно змінювати контракт після звичайного оновлення залежності.

Для ESMFold2 зафіксовано конкретний commit і виправлено шлях до репозиторію kernel-компонента. Фіксація версії зовнішнього коду зменшує ризик того, що віддалена зміна зламає відтворюваність або підмінить виконуваний компонент. Водночас командам варто самостійно блокувати hashes у lock-файлах і контролювати походження динамічно завантажуваних модулів.

Практична порада: не оновлюйте Transformers у production лише заради нового model class. Створіть окреме середовище, зафіксуйте версії PyTorch, Accelerate, tokenizer і kernels, а потім порівняйте пікову пам’ять, latency, детермінованість та якість відповідей.

Кому варто оновлюватися

  • Дослідникам GLM-5.3-Flash — реліз дає офіційний шлях запуску через Transformers.
  • Користувачам tensor parallel — виправлення повертає очікувану сумісність API.
  • Командам ESMFold2 — pinned kernel покращує контроль ланцюга постачання.
  • Усім іншим — можна дочекатися результатів CI та сумісності downstream-бібліотек, адже набір змін невеликий.

Джерело та права

Матеріал є самостійним українським переказом release notes Transformers 5.16.1 від 26 серпня 2026 року. Код і документація репозиторію поширюються за Apache License 2.0. Характеристики GLM-5.3-Flash подано як заяви авторів моделі, а не як незалежне тестування редакції. Перекладено, адаптовано й доповнено редакцією «Бібліотеки програміста».

Першоджерело:Hugging Face Transformers ↗

Матеріал перекладено, переказано та доповнено редакцією українською мовою.

</>

Читайте далі — ми вже розбираємо наступну важливу тему.

Далі за темою

Схожі матеріали