nopetnoget

GLM-Image

GLM-Image — модель генерації зображень на базі гібридної архітектури autoregressive + diffusion decoder. Система складається з autoregressive генератора (9B параметрів, ініціалізований з GLM-4-9B-0414) та 7B diffusion декодера з single-stream DiT архітектурою. На відміну від стандартних latent diffusion підходів, GLM-Image показує суттєві переваги в текст-рендерингу та knowledge-intensive сценаріях, особливо де потрібна точна семантична интерпретація. Підтримує не лише text-to-image, а й розширений набір image-to-image завдань: редагування, трансфер стилю, generation з збереженням identity та мультисуб'єктну консистентність. Постренінг з decoupled reinforcement learning (GRPO алгоритм) забезпечує fine-grained модульну стратегію feedback для покращення як семантичного розуміння, так і якості деталей.

Для кого

ML-інженери та дослідники, які працюють з генеративними моделями та потребують точного рендеринга тексту в зображеннях. Розробники, що інтегрують image-to-image трансформації та масштабовані генеративні pipeline. Компанії в дизайні, контент-продакшені та digital marketing, де важлива как універсальність, так і висока якість деталей.

Отзывы о проекте

Пока нет отзывов — будьте первым.

Войдите, чтобы оставить отзыв.