Формат архитектурных спецификаций может компенсировать слабость LLM-кодинга: результаты эксперимента
**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.
Формат архитектурных спецификаций может компенсировать слабость LLM-кодинга: результаты эксперимента
Кратко: Исследователи провели эксперимент с 5 форматами архитектурных спецификаций и 6 LLM-моделями от Anthropic, OpenAI и Google. Выяснилось, что на сильных моделях формат почти не влияет на качество кода, а на слабых — разница достигает 2,42 баллов, причем кодо-близкие форматы (OpenAPI, TypeScript) почти полностью устраняют отставание.
Что произошло
В рамках контролируемого эксперимента исследователи сравнили пять информационно эквивалентных форматов спецификаций архитектуры: неформальное описание на естественном языке, Mermaid-диаграммы с ограничениями и записями архитектурных решений (ADR), OpenAPI, C4/Structurizr DSL и TypeScript-интерфейсные контракты с правилами в стиле ArchUnit. Эти форматы тестировались на шести моделях из трёх семейств: Anthropic Claude, OpenAI GPT и Google Gemini. Всего было проведено 90 мульти-турных испытаний с участием AI-агентов, генерирующих код.
Результаты показали сильное взаимодействие между форматом и моделью. На самых мощных моделях (Sonnet 4.6, GPT-5) разброс качества кода между форматами составил всего 0,17–0,92 балла. На более слабых моделях разброс достигал 0,83–2,42 балла. При этом форматы, близкие к коду (OpenAPI и TypeScript-контракты), позволили восстановить большую часть разрыва в возможностях между слабыми и сильными моделями.
Что изменилось по сравнению с предыдущей версией
Данных о предыдущих версиях исследования нет. Это первое систематическое сравнение влияния формата архитектурных спецификаций на качество кода, сгенерированного LLM-агентами, в контролируемых условиях.
Цены и доступность
Исследование опубликовано в виде препринта на arXiv и доступно для свободного ознакомления. Коммерческие продукты или изменения в существующих моделях не анонсированы.
Почему это важно
Результаты показывают, что архитектура спецификации может выступать в роли «уравнителя возможностей» (capability equalizer) для моделей разной мощности. Это даёт практический инструмент: разработчики могут повысить качество кода, генерируемого слабыми моделями, просто выбрав подходящий формат описания архитектуры, без необходимости переходить на более дорогую или мощную модель.
Для пользователей AI-Sphere
Разработчикам, использующим AI-агентов для генерации кода, стоит учитывать: если ваша модель не относится к топовым (например, не Sonnet 4.6 или GPT-5), выбирайте кодо-близкие форматы спецификаций — OpenAPI или TypeScript-контракты с правилами. Это может существенно улучшить результат без дополнительных затрат на более мощную модель.
Источники
- arXiv preprint 2608.21747v1: https://arxiv.org/abs/2608.21747v1