GLM-Image
GLM-Image — модель генерації зображень на базі гібридної архітектури autoregressive + diffusion decoder. Система складається з autoregressive генератора (9B параметрів, ініціалізований з GLM-4-9B-0414) та 7B diffusion декодера з single-stream DiT архітектурою. На відміну від стандартних latent diffusion підходів, GLM-Image показує суттєві переваги в текст-рендерингу та knowledge-intensive сценаріях, особливо де потрібна точна семантична интерпретація. Підтримує не лише text-to-image, а й розширений набір image-to-image завдань: редагування, трансфер стилю, generation з збереженням identity та мультисуб'єктну консистентність. Постренінг з decoupled reinforcement learning (GRPO алгоритм) забезпечує fine-grained модульну стратегію feedback для покращення як семантичного розуміння, так і якості деталей.