Қолданбалы ЖИ-ді зерттеймін: кіші модельдерге білім көшіру, ұзын контекст тиімділігі, нейрокодектер және кванттау. Жұмыстарды ашық жариялаймын: мақала, салмақтар және код.
Мені қарапайым жабдықта жұмыс істейтін жүйелер қызықтырады: үлкен модельдердің мүмкіндіктеріне ие кіші модельдер, арзан инференс және деректерге бақылау. Төменде негізгі жұмыстар.
Зерттеу · arXivarXiv:2502.08213MITОқыту 10$-дан арзан
01LLM Modules: Knowledge Transfer from a Large to a Small Model using Enhanced Cross-Attention
Үлкен модельден кіші модельге білім көшіру
Кіші модельге үлкен модельдің білімін беру тәсілі — дистилляциясыз және толық қайта оқытусыз. Үлкен модель білім көзі ретінде қатырылады, кішісі «ойлаушы» ретінде оқытылады, ал cross-attention білімді араларында тасымалдайды.
Әдіс
Қатырылған мұғалім Qwen2-1.5B және оқытылатын студент GPT-Neo-125M, Bespoke-Stratos-17k датасеті. Мұғалімнің эмбеддингтері мен LM-head алынып, шығысы cross-attention қабаты арқылы өтеді; студент мұғалімнің токенизаторына сай өз LM-head алады.
Нәтиже
15 эпоха, бір NVIDIA L4-те шамамен 5 сағат, оқыту құны 10 доллардан аз; loss 13,8-ден ~1,1-ге дейін түсті. Кіші модель мұғалімнің құрылымды пайымдауын қайталайды.
Зерттеу · Paper + DOIDOI 10.57967/hf/8973Apache-2.0~5,04 млн параметр
02MPT-VC: Matryoshka Phase-on-Torus Video Codec
Детерминирленген операторларға құрылған бейне нейрокодегі
Толығымен детерминирленген операторлардан жиналған бейне нейрокодегі және токенизаторы. Бейне бір rate-ordered ағынға сығылады: файлдың басы превью береді, көбірек байт — жоғарырақ сапа, толық файл — толық сапа. Бір жазба қайта кодтаусыз бүкіл сапа сатысын қамтиды.
Әдіс
Үш деңгейлі матрёшка лаплас-пирамидасы, сызықтық құны бар терезелі axial 3D RoPE-внимание, сахна ауысуларындағы phase-jump, кодбуксыз FSQ және бит-дәл арифметикалық энтропия кодері.
Нәтиже
UVG-де Nvidia Cosmos Tokenizer-ден орташа Y-PSNR бойынша аз уақыт пен жадта асып түседі. Чекпойнт — 20,36 МБ, оқыту ~290 сағат бейнеде.
Ашық модельApache-2.0GGUF · 537 МБCPU-да ~44 ток/с
03Qwen3.5-0.8B GEC — KK · RU · EN
Қате, емле және тыныс белгілерін түзеткіш
Шикі мәтінді тазартатын ашық модель: тыныс белгілерін, бас әріптер мен абзацтарды қалпына келтіреді, қателер мен емлені түзетеді. Қазақ, орыс, ағылшын тілдері. Сөздер мен мағынаны сақтайды: қайта жазбайды, түзетеді.
Әдіс
Qwen3.5-0.8B файнтюні және өз кванттауымыз: бит-дәл train==deploy паритеті бар 4/8/16-биттік quantization-aware training. Қарапайым CPU-да llama.cpp, LM Studio және Ollama-да жұмыс істейді.
Ұзын контексті шағын жадқа сыйғызу тәсілі: көрші токендер негізгі қабаттар стегіне дейін мәндерге топталады, сөйтіп внимание токендер бойынша емес, топтар бойынша жұмыс істейді. Внимание жады N² орнына G² болып масштабталады.
Әдіс
Арнайы нөлінші қабат prefill кезінде көрші токендерді кластерлеп, топтарға орташалайды; жеңіл адаптер топтық эмбеддингтерді өңдейді. Тек осы қабат пен адаптер оқытылады, қалғаны қатырулы. Негізі — Qwen3-0.6B.
Ашық статус: жарияланған сандар әзірге жоқ. Бағыт көрсетуге болатын күйге жеткізілуде.