Kimi K3: Moonshot AI випустила першу відкриту нейромережу на 2.8 трлн параметрів

Людина дивиться на велетенського робота зі світною мережею вузлів на тілі

Moonshot знову підняла планку — і цього разу серйозно

16 липня 2026 року китайська компанія Moonshot AI випустила Kimi K3 — модель на 2.8 трильйона параметрів, перший у світі відкритий ШІ такого масштабу. Це не черговий проміжний апдейт з парою відсотків приросту на бенчмарках, а стрибок у зовсім інший ваговий клас: попередня флагманська Kimi K2 мала «лише» 1 трильйон параметрів, і навіть це вже вважалося величезною моделлю.

Якщо ви чули про Kimi раніше — можливо, ще за старою версією Kimi AI 1.5, безкоштовного конкурента ChatGPT з великим контекстним вікном — забудьте той образ. За півтора року Moonshot перетворилася з нішевого чат-бота на компанію, яка відкрито публікує ваги моделей, що за багатьма параметрами наступають на п’яти Claude і GPT. Розбираємось, що саме змінилося, як влаштований K3 під капотом і чи варто його пробувати вже зараз.

Від Kimi 1.5 до K3: чотири покоління за півтора року

Щоб зрозуміти, наскільки швидко Moonshot розганяється, варто подивитись на весь шлях, а не тільки на останній реліз.

Kimi 1.5 (початок 2025) був звичайним, хоч і сильним чат-ботом: контекст 200 тисяч символів, аналіз файлів, вбудований пошук в інтернеті. Корисний інструмент, але не претендент на технологічне лідерство.

Kimi K2 (липень 2025) — це вже зовсім інша історія. Moonshot випустила модель типу Mixture-of-Experts (MoE) на 1 трильйон параметрів, з яких на кожен токен активується лише 32 мільярди. Простіше кажучи: модель має величезний «банк знань», розділений на 384 вузькоспеціалізовані «експертні» підмережі, але для конкретного запиту вона задіює лише 8 із них одночасно. Це і є секрет, як зробити модель настільки великою, але при цьому не астрономічно дорогою в роботі — платите фактично за роботу невеликої частини мережі, а не за весь трильйон параметрів одразу. K2 одразу заявила про себе як модель, заточена під агентні задачі: виклик інструментів, автономне розв’язання задач, робота з кодом.

Kimi K2.5 (лютий 2026) додала нативну мультимодальність — модель почала розуміти зображення й відео не як «прибудований» окремий модуль, а на рівні базового навчання, разом із текстом. З’явився і Agent Swarm («рій агентів») — режим, у якому модель не просто послідовно виконує задачу, а розбиває її на частини й розподіляє між десятками паралельних вузькоспеціалізованих під-агентів, які працюють одночасно. Контекстне вікно виросло до 256 тисяч токенів.

Kimi K2.6 (весна 2026) — точковий, але відчутний апгрейд саме під довгі інженерні сесії: модель навчилася стабільніше тримати фокус у багатогодинних задачах з кодом, генерувати робочий фронтенд просто з візуального макета чи скріншота, а Agent Swarm розрісся до 300 під-агентів і 4000 узгоджених кроків в одному автономному прогоні.

І нарешті — Kimi K3, який виводить лінійку в зовсім інший масштаб.

Що таке Kimi K3 і чому Moonshot називає його історичною подією

K3 — перша відкрита модель, яка перетнула позначку в 3 трильйони параметрів (точніше, 2.8 трлн). До цього відкриті моделі такого розміру просто не існували — це були цифри, характерні хіба для закритих систем OpenAI чи Anthropic, ваги яких ніхто, крім самих компаній, не бачить. Moonshot же публікує повні ваги K3 у відкритому доступі: модель уже доступна для використання через Kimi.com, застосунок Kimi Work і API, а повні ваги для самостійного розгортання обіцяють викласти на Hugging Face до 27 липня 2026 року — тобто буквально протягом тижня після виходу цього матеріалу.

Сама компанія в анонсі чесно визнає: за сукупною якістю K3 усе ще поступається двом найсильнішим закритим моделям на ринку — Claude Fable 5 та GPT-5.6 Sol. Але при цьому послідовно випереджає всі інші протестовані моделі, включно з попередніми версіями GPT і Claude. Це важлива деталь, яка відрізняє чесний технічний анонс від маркетингового: Moonshot не намагається видати K3 за абсолютного лідера, а показує його реальне місце — топ відкритих моделей, впритул до найкращих закритих.

Що під капотом: Kimi Delta Attention і Attention Residuals

Щоб розігнати модель до 2.8 трильйона параметрів і при цьому не зробити її непідйомно дорогою в роботі, Moonshot переробила саму архітектуру, а не просто додала більше «шарів» до старої схеми.

Головна зміна — Kimi Delta Attention (KDA). Це новий спосіб обробки уваги (attention) — механізму, який визначає, на які частини тексту модель має «звертати увагу» під час генерації відповіді. Класичний механізм уваги в трансформерах порівнює кожен токен з кожним іншим, і обчислювальна вартість цього росте квадратично з довжиною тексту — саме тому довгий контекст завжди був дорогим задоволенням. KDA замінює це на «дельта-правило»: короткі згортки, нормалізовані ключі й керовані оновлення стану замість повної квадратичної матриці уваги. Простіше кажучи, замість того щоб щоразу порівнювати весь текст з усім текстом, модель веде компактний «біжучий підсумок» того, що вже прочитала, і оновлює його по ходу — це набагато дешевше при довгому контексті, а саме довгий контекст (K3 підтримує аж 1 мільйон токенів) і є однією з головних заявлених переваг моделі.

Друга частина — Attention Residuals (AttnRes). Якщо KDA відповідає за те, як модель обробляє довжину тексту, то AttnRes — за те, як інформація передається між шарами моделі вглиб. Замість того щоб просто накопичувати інформацію з попередніх шарів рівномірно, AttnRes вибірково «дотягується» до потрібних представлень на різній глибині мережі. Разом з масштабуванням розрідженості Mixture-of-Experts (модель тепер активує лише 16 із 896 «експертів» на токен, ще менша частка від загального розміру, ніж у K2) ці зміни дали приблизно 2.5-кратне покращення ефективності масштабування порівняно з K2 — тобто K3 навчається й працює ефективніше на кожен вкладений обчислювальний ресурс, а не просто «більший заради більшого».

Ще одна практична деталь: K3 навчена і квантована в форматі MXFP4/MXFP8 — це технологія стиснення чисел у моделі, яка дозволяє зберігати й рахувати ваги компактніше без істотної втрати якості. Завдяки цьому модель, попри свій розмір, залишається економічно реалістичною для розгортання — і в хмарі, і, зрештою, на власному залізі після публікації ваг.

На що K3 здатний на практиці

Moonshot ілюструє можливості K3 не абстрактними цифрами, а конкретними кейсами — і саме вони показують, куди рухається модель найбільше.

Довгі інженерні сесії. K3 може годинами самостійно працювати над складною задачею з кодом: орієнтуватись у величезних репозиторіях, викликати термінальні інструменти, доводити рефакторинг до кінця без постійного нагляду людини. В одному з тестів модель отримала 24 години в ізольованому середовищі на оптимізацію GPU-ядер (низькорівневого коду для відеокарт) і показала результат, порівнянний з Claude Fable 5 і помітно кращий за Opus 4.8, GPT-5.6 Sol та GPT-5.5.

Побудова компілятора з нуля. В одному з показових прикладів K3 самостійно написав MiniTriton — компактний компілятор для GPU-програмування зі своїм проміжним представленням коду, оптимізаційними прохідками й генерацією PTX-коду (низькорівневих інструкцій для відеокарт NVIDIA). За словами Moonshot, на окремих задачах MiniTriton обходить навіть Triton — індустріальний стандарт, над яким роками працювала команда NVIDIA.

Дизайн чипів. В одному 48-годинному автономному прогоні K3 спроєктував, оптимізував і верифікував чип для невеликої моделі на власній архітектурі, використовуючи відкриті інструменти для проєктування електроніки — практично від технічного завдання до готової до симуляції схеми.

Дослідницька робота. В одному з кейсів K3 за приблизно дві години відтворив складні астрофізичні залежності (I-Love-Q relations) — роботу, яка зазвичай займає у досвідченого дослідника один-два тижні: переглянув і перехресно перевірив понад 20 наукових статей, реалізував повний обчислювальний конвеєр, оцінив понад 300 рівнянь стану речовини, знайшов невідповідності в опублікованих формулах і згенерував понад 3000 рядків коду на Python з інтерактивним дашбордом результатів.

Робота зі знаннями й відео. У застосунку Kimi Work модель уміє перетворювати запити на інтерактивні звіти з графіками й діаграмами, а завдяки нативному розумінню відео — самостійно монтувати ролики: в одному прикладі K3 зібрав тизер із 56 вихідних кліпів, підібравши монтажні склейки під ритм і озвучку, — роботу, яку досвідчений монтажер робить один-два дні, а новачок — три-п’ять.

Скільки коштує і як спробувати

Kimi K3 уже доступний, і спробувати його можна кількома шляхами.

Найпростіше — застосунок чи сайт Kimi.com (iOS, Android, HarmonyOS або браузер). Є безкоштовний план Adagio: необмежений базовий чат, завантаження документів і веб-пошук, але лише 6 «агентних» кредитів на місяць і жодного доступу до Agent Swarm. Платні плани — Moderato ($19/міс), Allegretto ($39/міс), Allegro ($99/міс) і Vivace ($199/міс) — відрізняються кількістю кредитів, паралельних агентних задач і доступом до Agent Swarm та Kimi Code. Річна оплата дає знижку до $480 на рік на найстаршому тарифі.

Для розробників є API на платформі platform.kimi.ai: модель називається kimi-k3, а ціна за мільйон токенів — $0.30 при попаданні в кеш, $3 за вхідні токени без кешу і $15 за вихідні. Для команд є окремий Kimi Enterprise з розділенням особистих і корпоративних акаунтів.

Головне, на що варто зважати вже зараз: на старті K3 працює лише в режимі максимального «рівня роздумів» (thinking effort) — легший і швидший режими Moonshot обіцяє додати пізніше. А повний набір ваг моделі для самостійного розгортання на власному залізі з’явиться на Hugging Face до 27 липня 2026 року.

І ось показовий штрих до всієї історії: за даними української тех-преси, попит на платні підписки виявився настільки високим, що вже за кілька днів після релізу Moonshot тимчасово призупинила реєстрацію нових платних підписників — компанія просто не встигає нарощувати обчислювальні потужності під навантаження. Для моделі, яка й так позиціонується як «наздоганяюча» лідерів, це доволі красномовний сигнал реального інтересу, а не тільки маркетингового шуму.

Підводні камені

Сама Moonshot у технічному анонсі відкрито називає три обмеження — і це варто знати перед тим, як довіряти K3 серйозну задачу.

По-перше, модель чутлива до збереження історії міркувань (thinking history) між кроками розмови. Якщо агентне середовище не передає назад повний ланцюжок попередніх роздумів моделі, або якщо ви на середині сесії перемикаєтесь на K3 з іншої моделі, якість відповідей може стати нестабільною. Moonshot прямо радить використовувати перевірені агентні середовища на кшталт Kimi Code і не перемикати модель посеред активної сесії.

По-друге, K3 навчена бути дуже проактивною у довгих складних задачах — і це працює проти вас, коли завдання неоднозначне. Натрапивши на дрібну перешкоду чи нечітко сформульований намір користувача, модель може самостійно прийняти рішення за вас, замість того щоб зупинитись і перепитати. Якщо вам потрібна передбачувана поведінка в чітких межах — прописуйте це явно в системному промпті чи файлі інструкцій агента.

По-третє — і це чесне визнання, а не дрібний друк — Moonshot прямо пише, що користувацький досвід K3 усе ще помітно поступається Claude Fable 5 і GPT-5.6 Sol, навіть попри конкурентні результати на бенчмарках. Цифри в тестах — це ще не те саме, що відчуття від щоденної роботи з інструментом.

Кому варто спробувати Kimi K3 вже зараз

Якщо ви шукаєте готовий, відполірований інструмент на щодень — K3 поки не привід негайно кидати Claude чи ChatGPT: за визнанням самої Moonshot, до найкращих закритих моделей йому ще трохи бракує саме на рівні відчуття від використання.

Але якщо вам цікава відкрита модель такого масштабу для самостійного розгортання, дослідницьких експериментів чи довгих автономних агентних задач з кодом — K3 вартий уваги вже сьогодні, а після публікації повних ваг 27 липня стане ще доступнішим. Це перша відкрита модель у класі 3 трильйонів параметрів, і сам факт, що така модель узагалі існує у відкритому доступі, — подія, яка вплине на всю індустрію набагато ширше, ніж на самих користувачів Kimi.

Підпишіться на новини про штучний інтелект!

Ви будете отримувати від нас листи раз на тиждень.
Політика конфіденційності

Залишити коментар

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *

Прокрутка до верху