Оди на содржината
Сите статии

Од 7 години до 7 дена со агентска вештачка интелигенција

од Ghazi Triki · 5 мин. читање

Од седум години до седум дена
Во оваа статија

Ако некогаш сте гледале табела за COCOMO II како предвидува 33 календарски месеци за проект што вашиот тим го испорачал за два спринта, проблемот веќе ви е познат: секој модел за проценка што денес се користи во пракса е калибриран за свет во кој развивачите ја пишуваат секоја линија сами, префрлањето меѓу контексти има своја цена, а календарот застанува во 17 часот. Тој свет повеќе не постои. Неодамна развивме од нула апликација со 286 KLOC, 672 датотеки и повеќе подсистеми (протоколски слој, слој за податоци, механизам за рендерирање, интеграција со платформите) и стигнавме до алфа-верзија подготвена за тестирање за 7 дена. Целиот сет модели (COCOMO Basic/Intermediate/Post-Architecture, Function Points, основата SLOC, Putnam/SLIM) даде медијана на предвидувањата од 30,3 календарски месеци. Медијаната на мултипликаторот на продуктивноста: 4.240×. Дури и најконзервативната основа (25 SLOC на ден по развивач за сложени системи) згрешила 1.433×. Моделите не се погрешни. Погрешно се применуваат. Подолу следуваат анализата модел по модел, емпириската калибрација врз работата на истиот автор и она што навистина го вели литературата за RCT-студиите од 2024 до 2026 година за тоа каде агентската вештачка интелигенција (ВИ) го скратува времетраењето, а каде не.

Проектот што ги урна проценките

Во RIADVICE неодамна развивме сложена апликација богата со функции, од типот што координира повеќе подсистеми низ дистрибуирана архитектура, како нативна повеќеплатформска околина за мобилни уреди и компјутери од една кодна база, поттикната од барањата на пазарот што бараа нова имплементација. Кодната база го покажува обемот:

  • 286.662 SLOC (~286 KLOC) распределени во 672 изворни датотеки
  • 1.329.399 линии вкупни промени: 862.488 додавања и 466.911 бришења
  • 700 комити за 7 активни развојни дена до првата алфа-верзија подготвена за тестирање
  • Целосна интернационализација на десетици јазици
  • Повеќе меѓусебно сосема неповрзани подсистеми (обработка на протоколи, управување со податоци, рендерирање и интеграција со платформите), сите изградени од нула за целната околина

Ова не беше обвивка ниту површно ново лице. Беше нативна имплементација изградена од темел, за да ги исполни барањата на пазарот што постојните решенија не можеа да ги исполнат. Пред да напишам ниту една линија, во проектот вклучив сопствена алатка за анализа што го извршува целиот сет индустриски стандардни модели за проценка на трудот во развојот на софтвер врз кодната база додека расте. Целта беше искрена: да се измери јазот меѓу она што го предвидуваат класичните модели и она што навистина го дава испораката со помош на ВИ. Резултатите не се грешка во заокружувањето. Тие се прекин на категоријата.

Што предвидоа моделите за проценка, а што навистина се случи

Алатката го извршува секој поголем модел за проценка од литературата за софтверско инженерство: COCOMO Basic (Organic, Semi-Detached, Embedded), COCOMO Intermediate (Semi-Detached и Embedded, подесени), COCOMO II Post-Architecture (подесен), Function Points, основата за продуктивност SLOC и Putnam/SLIM, калибрирани за типот на проектот со објавените константи од оригиналната изворна литература.

Модел за проценкаПредвиден трудПредвидено календарско времеЗабрзување во однос на реалното
COCOMO Basic (Organic)913 човек-месеци33,3 месеци2.282×
COCOMO Basic (Semi-Detached)1.696 човек-месеци33,7 месеци4.240×
COCOMO Basic (Embedded)3.200 човек-месеци33,1 месеци8.000×
COCOMO Intermediate (Semi-Det., подесен)1.259 човек-месеци30,4 месеци3.148×
COCOMO Intermediate (Embedded, подесен)2.376 човек-месеци30,1 месеци5.940×
COCOMO II Post-Architecture (подесен)1.703 човек-месеци30,3 месеци4.257×
Function Points (груба пресметка)17,9 човек-месеци7,5 месеци45×
Основа за продуктивност SLOC (25 SLOC/ден)573 човек-месеци573,3 месеци1.433×
Putnam/SLIMпрескокнат (времетраење < 30 дена; T 4/3 експлодира)н/пн/п

Медијаната на мултипликаторот на продуктивноста низ сите модели е 4.240×. Дури и најконзервативниот модел предвидува време на испорака околу 1.400 пати подолго од она што се случило. Најоптимистичкиот, Function Points, сепак предвиде 7,5 календарски месеци, 45× подолго од реалните 7 дена. Според моделите, проектот требало да трае од 7 месеци до 47 години. Алфа-верзијата беше подготвена за тестирање за 7 дена.

Моделите не се согласуваат меѓу себе, и тоа од 50× до 8.000×

Овие модели не се согласуваат меѓу себе. За истата кодна база, предвидувањата се движат од 17,9 до 3.200 човек-месеци, што е распон од 178×. Споредбената анализа SEAA 2013 на COCOMO II, SEER-SEM, SLIM и TruePlanning врз 51 реален проект утврдила MMRE од 50 до 100%. Една евалуација од 2023 година врз збирот податоци COCOMO NASA утврдила MMRE близу 1,0 и PRED(0.25) = 0,0: ниту еден проект не бил проценет во рамките на опсегот на грешка од 25%. Моделите никогаш не биле дизајнирани за проект развиван со помош на ВИ. Но големината на јазот, дури и кога ќе се земе предвид неточноста на моделите, ни кажува дека нешто структурно се променило.

Што навистина велат истражувањата за агентската ВИ и продуктивноста на развивачите

Бројката 4.240× е екстремна и не сакам да ја преувеличувам. Изградбата на нов проект од нула ги надувува промените во кодот, а SLOC е слаб показател за вредноста. Затоа да ја погледнеме рецензираната литература. Асистентите од типот Copilot носат скромни, но вистински придобивки. Peng и соработниците (2023) утврдиле дека развивачите што користат ВИ како програмерски партнер завршиле задача 55,8% побрзо (95% CI: 21 до 89%). RCT-студијата на Microsoft/Accenture/Fortune 100 (2025), најголемата досега, со n=4.867, утврдила 26% повеќе завршени задачи. Интерната RCT-студија на Google (2024) утврдила намалување на времето по задача од ~21%. Теренскиот експеримент на BIS/Ant Group (2024) измерил 55% поголем излез на код кај помладиот персонал. Искреното резиме: од 1,26× до 1,56× за соодветни задачи. Вистински, но не и преобразувачки. Агентската ВИ работи во поинаков режим. Прегледот на Devin од Cognition за 2025 година пријавил резултати кај клиентите од 10× при ETL-миграции, 14× при миграции на верзии на Java и 20× при безбедносни поправки. Nubank пријави 12× подобрување на ефикасноста и 20× заштеда на трошоците при рефакторирање на повеќе милиони линии код, претходно проценето како повеќегодишен напор на илјада инженери. Нашата имплементација е токму во овој опсег: хистограмот на комитите покажува густи изливи во 22:00, 00:00 и 01:00 часот, што е потпис на сесии водени од агенти. Спротивните докази се вистински. RCT-студијата на Metr.org од 2025 година (16 искусни развивачи, 246 задачи на зрели проекти) утврдила дека ВИ го зголемила времето за завршување за 19%: ги забавила искусните развивачи на познати кодни бази. Студија од 2026 година со методот „разлика во разликите“ врз 807 GitHub-репозиториуми што усвоиле алатки со ВИ (He и соработниците, MSR ’26) утврдила „минливо“ зголемување на брзината и „трајно“ зголемување на сложеноста на кодот, што довело до долгорочно забавување. Насловот кажува сѐ: Speed at the Cost of Quality. Консензусот: ВИ многу помага при нов развој од нула и при структуриран развој, скромно помага при задачи за дополнување код и може да ја намали брзината на зрели кодни бази. Долгот во квалитетот е вистински.

Зошто моделите паѓаат: три структурни промени

Ниту еден од факторите на трошоци во класичните модели нема поставка за „развивачот има автономен агент што никогаш не спие и ја држи целата кодна база во контекст“. Три промени ја урнуваат кривата на времетраењето:

  1. Тесното грло на пишувањето исчезна.

Моделите претпоставуваат дека значителен дел од трудот е механички: шаблонски код, скелети, повторливи рефакторирања, ресурси за локализација и други структурирани податоци. Во оваа имплементација, голем дел од обемот е многу правилен текст и поврзување што агентот може масовно да го генерира или трансформира. Самиот рачно пишуван код (скелети, конструктори, лепило за платформите) сега се генерира во изливи, а не се пишува линија по линија.

  1. Трошокот за префрлање меѓу контексти се урива.

Човек што се префрла меѓу протоколскиот слој, слојот за податоци и механизмот за рендерирање плаќа данок за вчитување на контекстот секој пат. Агент што го прочитал целиот репозиториум од 672 датотеки го плаќа само еднаш. Таа асиметрија брзо се натрупува кај кодна база со оваа големина.

  1. Календарот повеќе не е тесното грло.

Моделите ги претвораат човек-месеците во календарски месеци преку равенка за ангажирање кадар што претпоставува човечки работен ден. Сесиите со агенти работат преку ноќ. Хистограмот на комитите покажува постојан излез од 07:00 до 01:00 часот: 18 активни часа, а не 8.

Емпириска калибрација врз работата на истиот автор

Параметарските модели се разминуваат за неколку редови големина, па спроведов и емпириска калибрација меѓу проекти, споредувајќи ги сопствените промени во кодот по човек-ден пред и по усвојувањето на алатка за агентска ВИ, на три други продукциски репозиториуми од истиот екосистем:

ПроектПромени/ден пред ВИПромени/ден со ВИМултипликатор
Проект А (балансер на оптоварување)6732.0563,1×
Проект Б (услуга за извештаи)2392.1278,9×
Проект В (услуга за обработка)1.3229820,7×
Збирно (просек / медијана)н/пн/п4,2× / 3,1×

Истиот автор, истиот домен, вистинска работа на одржување. Емпирискиот мултипликатор е од 3× до 9×, многу поконзервативен од бројката 4.240× за нов развој од нула и во согласност со горниот крај на објавените истражувања за агентската ВИ. Еден проект всушност станал побавен: придобивките зависат од задачата и не се универзални.

Што значи ова за планирањето проекти

Ако сѐ уште ги проценувате софтверските проекти со некалибрирани модели и со основа од 25 SLOC на ден, при работа со помош на ВИ ќе згрешите за еден до три реда големина. Еве што правиме во RIADVICE:

  1. Калибрирајте според сопствената историја. Споредете го сопствениот излез на код по човек-ден со и без ВИ. Тоа е поевтино, поискрено и дава опсег од 3× до 9× што можете да го одбраните во проектниот план.
  2. Одделете го новиот развој од одржувањето. Мултипликаторот на агентската ВИ е најголем при нов развој од нула и при структуриран развој, а најмал (понекогаш и негативен) при одржување на зрели кодни бази. Не применувајте еден број за двете.
  3. Предвидете буџет за долгот во квалитетот. Брзината со ВИ доаѓа со трајно зголемување на сложеноста. Планирајте фаза на зацврстување и следете ја со метрики: следете ја цикломатската сложеност и извршувајте откривање на копиран код при секое издание.
  4. Проценувајте ја целата крива, а не само нејзиниот почеток. Зголемување на брзината од 10× што ја удвојува густината на дефекти не е зголемување од 10×: тоа е распоред повлечен нанапред по цена на подолг период на стабилизација.

Заклучок

Проект за кој секој модел за проценка вели дека треба да трае од 7 месеци до 47 години стигна до алфа-верзија подготвена за тестирање за 7 дена. Медијаната на мултипликаторот од 4.240× не треба да стане ничиј проектен план. Но таа е јасен сигнал дека времетраењето на сложениот развој на софтвер повторно се збива под дејство на истата сила што го збива трудот. Објавените истражувања покажуваат дека ВИ носи сѐ од побуда од 1,26× до скок од 20×, со реален ризик од негативен поврат на зрели кодни бази и со мерлив данок врз квалитетот. Моделите што ни кажуваа дека овој проект треба да трае децении се истите модели што и денес работат во корпоративните табели за проценка. Прашањето не е дали агентската ВИ го менува времетраењето на проектите: истражувањата веќе одговорија на тоа. Прашањето е дали вашата практика на проценување ги стигнала доказите. Ако вашите бројки сѐ уште доаѓаат од модел од 1981 година, калибриран врз COBOL и асемблер, време е за повторна калибрација, или барем да престанете да му верувате на календарот што го печати.

„Сѐ уште има значителен простор за подобрување за подобро да се одговори на предизвиците на предвидувањето со кои се соочува праксата.“

Accuracy of Contemporary Parametric Software Estimation Models, SEAA 2013

🏆 Доверлива инженерска и облачна експертиза

RIADVICE: вашиот доверлив партнер во софтверското инженерство

Дизајнираме, градиме и имплементираме сложени софтверски системи со инженерската дисциплина и алатките потребни за испорака во ерата на ВИ: навреме, во рамките на буџетот и со квалитет.

Дознајте повеќе за нашите услуги →

📚 Извори и дополнително читање

Оваа статија се потпира на рецензирани истражувања, рандомизирани контролирани испитувања и индустриски теренски извештаи за продуктивноста во развојот на софтвер со помош на ВИ и за проценката на трудот во развојот на софтвер:

⚡ RIADVICE.com нуди доверливо инженерство, облачна експертиза и софтверски решенија од корпоративно ниво: навреме, во рамките на буџетот и со квалитет.