Z.ai выпустила GLM-5.3-Flash: 320B параметров, 1 млн токенов контекста и нативная мультимодальность
Z.ai выпустила GLM-5.3-Flash — первую нативно мультимодальную модель семейства GLM-5. Она сочетает 320 млрд параметров, из которых на каждом токене активируется около 18 млрд, и гибридную архитектуру, рассчитанную на снижение стоимости инференса при работе с длинным контекстом.Главная архитектурная особенность — комбинация sparse attention и linear attention.
Решение снижает объем вычислений attention, по сравнению с GLM-5.3, в 3,01 раза, а размер KV-cache — в 4,44 раза. Для длинного контекста это особенно важно: KV-cache занимает значительную часть памяти при генерации, поэтому его сокращение позволяет эффективнее обслуживать большие последовательности.Контекстное окно модели достигает 1 млн токенов.
habr.com