Исследования

Формат архитектурных спецификаций может компенсировать слабость LLM-кодинга: результаты эксперимента

Автор: AI-Sphere· обновлено 25 августа 2026 г. в 01:32· 5 мин чтения
Источники: arxiv.org
> **⚠️ Status: preprint > This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

Формат архитектурных спецификаций может компенсировать слабость LLM-кодинга: результаты эксперимента

Кратко: Исследователи провели эксперимент с 5 форматами архитектурных спецификаций и 6 LLM-моделями от Anthropic, OpenAI и Google. Выяснилось, что на сильных моделях формат почти не влияет на качество кода, а на слабых — разница достигает 2,42 баллов, причем кодо-близкие форматы (OpenAPI, TypeScript) почти полностью устраняют отставание.

Что произошло

В рамках контролируемого эксперимента исследователи сравнили пять информационно эквивалентных форматов спецификаций архитектуры: неформальное описание на естественном языке, Mermaid-диаграммы с ограничениями и записями архитектурных решений (ADR), OpenAPI, C4/Structurizr DSL и TypeScript-интерфейсные контракты с правилами в стиле ArchUnit. Эти форматы тестировались на шести моделях из трёх семейств: Anthropic Claude, OpenAI GPT и Google Gemini. Всего было проведено 90 мульти-турных испытаний с участием AI-агентов, генерирующих код.

Результаты показали сильное взаимодействие между форматом и моделью. На самых мощных моделях (Sonnet 4.6, GPT-5) разброс качества кода между форматами составил всего 0,17–0,92 балла. На более слабых моделях разброс достигал 0,83–2,42 балла. При этом форматы, близкие к коду (OpenAPI и TypeScript-контракты), позволили восстановить большую часть разрыва в возможностях между слабыми и сильными моделями.

Что изменилось по сравнению с предыдущей версией

Данных о предыдущих версиях исследования нет. Это первое систематическое сравнение влияния формата архитектурных спецификаций на качество кода, сгенерированного LLM-агентами, в контролируемых условиях.

Цены и доступность

Исследование опубликовано в виде препринта на arXiv и доступно для свободного ознакомления. Коммерческие продукты или изменения в существующих моделях не анонсированы.

Почему это важно

Результаты показывают, что архитектура спецификации может выступать в роли «уравнителя возможностей» (capability equalizer) для моделей разной мощности. Это даёт практический инструмент: разработчики могут повысить качество кода, генерируемого слабыми моделями, просто выбрав подходящий формат описания архитектуры, без необходимости переходить на более дорогую или мощную модель.

Для пользователей AI-Sphere

Разработчикам, использующим AI-агентов для генерации кода, стоит учитывать: если ваша модель не относится к топовым (например, не Sonnet 4.6 или GPT-5), выбирайте кодо-близкие форматы спецификаций — OpenAPI или TypeScript-контракты с правилами. Это может существенно улучшить результат без дополнительных затрат на более мощную модель.

Источники

#coding agents#LLM#architecture specification#research

Попробуйте сами

Задайте вопрос любой нейросети прямо сейчас — без VPN и иностранной карты

Начать чат