SubQ
SubQ — перша мовна модель, побудована на повністю субквадратичній sparse-attention архітектурі. На відміну від традиційних LLM, які обробляють всі можливі зв'язки між словами (O(n²)), SubQ фокусується лише на важливих залежностях, досягаючи лінійної складності O(n). Це дозволяє обробляти 12 мільйонів токенів в одному промпті — цілі репозиторії, місяці PR'ів, стан агентів — за одну п'яту вартості конкурентів. Модель видає 150 токенів на секунду і показує 87.6% на SWE-Bench Verified, 95.6% на RULER і 86.2% на MRCR v2. Технологія зменшує обчислення attention майже в 1000 разів на 12M токенах, кардинально змінюючи принципи масштабування LLM.