Kimi K2.5: новая открытая мультимодальная модель для агентного ИИ
**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.
Кратко: Исследователи представили Kimi K2.5 — открытую мультимодальную модель, нацеленную на продвижение общего агентного интеллекта. Модель объединяет обучение текста и зрения, а также использует новый фреймворк Agent Swarm для параллельного выполнения сложных задач.
Что произошло
Опубликована препринтная статья на arXiv, описывающая Kimi K2.5. Ключевые особенности:
- Совместное дообучение текста и зрения (joint text-vision pre-training, zero-vision SFT, joint text-vision reinforcement learning).
- Встроенный фреймворк Agent Swarm, который динамически декомпозирует сложные задачи на гетерогенные подзадачи и выполняет их конкурентно.
- Модель показывает state-of-the-art результаты в кодинге, визуальных задачах, рассуждениях и агентных сценариях.
- Agent Swarm снижает задержку до 4.5 раз по сравнению с одноагентными подходами.
- Разработчики выпускают пост-обученный чекпоинт модели для исследований и реальных приложений.
Что изменилось по сравнению с предыдущей версией
Kimi K2.5 является новой моделью, информации о предыдущих версиях в опубликованных данных нет.
Цены и доступность
Модель распространяется с открытым исходным кодом — чекпоинт доступен для скачивания. Цена не указана. Работает на основе архитектуры, описанной в препринте.
Почему это важно
Kimi K2.5 демонстрирует, что совместная оптимизация текста и зрения может значительно улучшить агентные способности ИИ. Фреймворк Agent Swarm предлагает новый подход к масштабированию сложных задач, а открытость модели способствует развитию исследований и практических внедрений в области агентного интеллекта.
Для пользователей AI-Sphere
Открытый чекпоинт Kimi K2.5 позволяет разработчикам и исследователям экспериментировать с передовым мультимодальным агентом, не завися от проприетарных решений. Модель может быть полезна для автоматизации многозадачных процессов, где требуется одновременная работа с текстом и изображениями.
Источники