Мазмұнға өту

ЖИ және LLM зерттеулері

Қолданбалы ЖИ-ді зерттеймін: кіші модельдерге білім көшіру, ұзын контекст тиімділігі, нейрокодектер және кванттау. Жұмыстарды ашық жариялаймын: мақала, салмақтар және код.

Мені қарапайым жабдықта жұмыс істейтін жүйелер қызықтырады: үлкен модельдердің мүмкіндіктеріне ие кіші модельдер, арзан инференс және деректерге бақылау. Төменде негізгі жұмыстар.

Зерттеу · arXivarXiv:2502.08213MITОқыту 10$-дан арзан

LLM Modules: Knowledge Transfer from a Large to a Small Model using Enhanced Cross-Attention

Үлкен модельден кіші модельге білім көшіру

Кіші модельге үлкен модельдің білімін беру тәсілі — дистилляциясыз және толық қайта оқытусыз. Үлкен модель білім көзі ретінде қатырылады, кішісі «ойлаушы» ретінде оқытылады, ал cross-attention білімді араларында тасымалдайды.

Әдіс

Қатырылған мұғалім Qwen2-1.5B және оқытылатын студент GPT-Neo-125M, Bespoke-Stratos-17k датасеті. Мұғалімнің эмбеддингтері мен LM-head алынып, шығысы cross-attention қабаты арқылы өтеді; студент мұғалімнің токенизаторына сай өз LM-head алады.

Нәтиже

15 эпоха, бір NVIDIA L4-те шамамен 5 сағат, оқыту құны 10 доллардан аз; loss 13,8-ден ~1,1-ге дейін түсті. Кіші модель мұғалімнің құрылымды пайымдауын қайталайды.

Зерттеу · Paper + DOIDOI 10.57967/hf/8973Apache-2.0~5,04 млн параметр

MPT-VC: Matryoshka Phase-on-Torus Video Codec

Детерминирленген операторларға құрылған бейне нейрокодегі

Толығымен детерминирленген операторлардан жиналған бейне нейрокодегі және токенизаторы. Бейне бір rate-ordered ағынға сығылады: файлдың басы превью береді, көбірек байт — жоғарырақ сапа, толық файл — толық сапа. Бір жазба қайта кодтаусыз бүкіл сапа сатысын қамтиды.

Әдіс

Үш деңгейлі матрёшка лаплас-пирамидасы, сызықтық құны бар терезелі axial 3D RoPE-внимание, сахна ауысуларындағы phase-jump, кодбуксыз FSQ және бит-дәл арифметикалық энтропия кодері.

Нәтиже

UVG-де Nvidia Cosmos Tokenizer-ден орташа Y-PSNR бойынша аз уақыт пен жадта асып түседі. Чекпойнт — 20,36 МБ, оқыту ~290 сағат бейнеде.

Ашық модельApache-2.0GGUF · 537 МБCPU-да ~44 ток/с

Qwen3.5-0.8B GEC — KK · RU · EN

Қате, емле және тыныс белгілерін түзеткіш

Шикі мәтінді тазартатын ашық модель: тыныс белгілерін, бас әріптер мен абзацтарды қалпына келтіреді, қателер мен емлені түзетеді. Қазақ, орыс, ағылшын тілдері. Сөздер мен мағынаны сақтайды: қайта жазбайды, түзетеді.

Әдіс

Qwen3.5-0.8B файнтюні және өз кванттауымыз: бит-дәл train==deploy паритеті бар 4/8/16-биттік quantization-aware training. Қарапайым CPU-да llama.cpp, LM Studio және Ollama-да жұмыс істейді.

Зерттеу · жұмыс үстіндеMITЖұмыс үстінде

Context Merging

Токендерден мәндер мен концептілерге

Ұзын контексті шағын жадқа сыйғызу тәсілі: көрші токендер негізгі қабаттар стегіне дейін мәндерге топталады, сөйтіп внимание токендер бойынша емес, топтар бойынша жұмыс істейді. Внимание жады N² орнына G² болып масштабталады.

Әдіс

Арнайы нөлінші қабат prefill кезінде көрші токендерді кластерлеп, топтарға орташалайды; жеңіл адаптер топтық эмбеддингтерді өңдейді. Тек осы қабат пен адаптер оқытылады, қалғаны қатырулы. Негізі — Qwen3-0.6B.

Ашық статус: жарияланған сандар әзірге жоқ. Бағыт көрсетуге болатын күйге жеткізілуде.

05Профильдер

Жұмыстар қайда орналасқан

Мақалалар мен салмақтар ашық жарияланған.

Зерттеу ынтымақтастығы

Бірлескен жұмыстарға, рецензиялауға және баяндамаларға ашықпын: кіші модельдер, білім көшіру, on-device ЖИ.

Константин Коломейцев

Константин Коломейцев — CAIO (Chief AI Officer), AI/LLM-сәулетші, Loqira Labs зертханасының негізін қалаушы және қолданбалы жасанды интеллект зерттеушісі. Алматы, Қазақстан. Компанияларға ЖИ-жүйелерді бағалауға, жобалауға және енгізуге көмектеседі: LLM, RAG, AI-агенттер, жергілікті модельдер және бизнес-процестерді автоматтандыру. ЖИ бойынша кеңес береді және корпоративтік оқыту өткізеді.

libr@bk.ru·Алматы, Қазақстан

© 2026 Константин Коломейцев · CAIO · AI/LLM-сәулетшіЖИ енгізу, кеңес беру және оқыту · Қазақстан және бүкіл әлем