Во оваа статија
Ако некогаш сте гледале табела за COCOMO II како предвидува 33 календарски месеци за проект што вашиот тим го испорачал за два спринта, проблемот веќе ви е познат: секој модел за проценка што денес се користи во пракса е калибриран за свет во кој развивачите ја пишуваат секоја линија сами, префрлањето меѓу контексти има своја цена, а календарот застанува во 17 часот. Тој свет повеќе не постои. Неодамна развивме од нула апликација со 286 KLOC, 672 датотеки и повеќе подсистеми (протоколски слој, слој за податоци, механизам за рендерирање, интеграција со платформите) и стигнавме до алфа-верзија подготвена за тестирање за 7 дена. Целиот сет модели (COCOMO Basic/Intermediate/Post-Architecture, Function Points, основата SLOC, Putnam/SLIM) даде медијана на предвидувањата од 30,3 календарски месеци. Медијаната на мултипликаторот на продуктивноста: 4.240×. Дури и најконзервативната основа (25 SLOC на ден по развивач за сложени системи) згрешила 1.433×. Моделите не се погрешни. Погрешно се применуваат. Подолу следуваат анализата модел по модел, емпириската калибрација врз работата на истиот автор и она што навистина го вели литературата за RCT-студиите од 2024 до 2026 година за тоа каде агентската вештачка интелигенција (ВИ) го скратува времетраењето, а каде не.
Проектот што ги урна проценките
Во RIADVICE неодамна развивме сложена апликација богата со функции, од типот што координира повеќе подсистеми низ дистрибуирана архитектура, како нативна повеќеплатформска околина за мобилни уреди и компјутери од една кодна база, поттикната од барањата на пазарот што бараа нова имплементација. Кодната база го покажува обемот:
- 286.662 SLOC (~286 KLOC) распределени во 672 изворни датотеки
- 1.329.399 линии вкупни промени: 862.488 додавања и 466.911 бришења
- 700 комити за 7 активни развојни дена до првата алфа-верзија подготвена за тестирање
- Целосна интернационализација на десетици јазици
- Повеќе меѓусебно сосема неповрзани подсистеми (обработка на протоколи, управување со податоци, рендерирање и интеграција со платформите), сите изградени од нула за целната околина
Ова не беше обвивка ниту површно ново лице. Беше нативна имплементација изградена од темел, за да ги исполни барањата на пазарот што постојните решенија не можеа да ги исполнат. Пред да напишам ниту една линија, во проектот вклучив сопствена алатка за анализа што го извршува целиот сет индустриски стандардни модели за проценка на трудот во развојот на софтвер врз кодната база додека расте. Целта беше искрена: да се измери јазот меѓу она што го предвидуваат класичните модели и она што навистина го дава испораката со помош на ВИ. Резултатите не се грешка во заокружувањето. Тие се прекин на категоријата.
Што предвидоа моделите за проценка, а што навистина се случи
Алатката го извршува секој поголем модел за проценка од литературата за софтверско инженерство: COCOMO Basic (Organic, Semi-Detached, Embedded), COCOMO Intermediate (Semi-Detached и Embedded, подесени), COCOMO II Post-Architecture (подесен), Function Points, основата за продуктивност SLOC и Putnam/SLIM, калибрирани за типот на проектот со објавените константи од оригиналната изворна литература.
| Модел за проценка | Предвиден труд | Предвидено календарско време | Забрзување во однос на реалното |
|---|---|---|---|
| COCOMO Basic (Organic) | 913 човек-месеци | 33,3 месеци | 2.282× |
| COCOMO Basic (Semi-Detached) | 1.696 човек-месеци | 33,7 месеци | 4.240× |
| COCOMO Basic (Embedded) | 3.200 човек-месеци | 33,1 месеци | 8.000× |
| COCOMO Intermediate (Semi-Det., подесен) | 1.259 човек-месеци | 30,4 месеци | 3.148× |
| COCOMO Intermediate (Embedded, подесен) | 2.376 човек-месеци | 30,1 месеци | 5.940× |
| COCOMO II Post-Architecture (подесен) | 1.703 човек-месеци | 30,3 месеци | 4.257× |
| Function Points (груба пресметка) | 17,9 човек-месеци | 7,5 месеци | 45× |
| Основа за продуктивност SLOC (25 SLOC/ден) | 573 човек-месеци | 573,3 месеци | 1.433× |
| Putnam/SLIM | прескокнат (времетраење < 30 дена; T 4/3 експлодира) | н/п | н/п |
Медијаната на мултипликаторот на продуктивноста низ сите модели е 4.240×. Дури и најконзервативниот модел предвидува време на испорака околу 1.400 пати подолго од она што се случило. Најоптимистичкиот, Function Points, сепак предвиде 7,5 календарски месеци, 45× подолго од реалните 7 дена. Според моделите, проектот требало да трае од 7 месеци до 47 години. Алфа-верзијата беше подготвена за тестирање за 7 дена.
Моделите не се согласуваат меѓу себе, и тоа од 50× до 8.000×
Овие модели не се согласуваат меѓу себе. За истата кодна база, предвидувањата се движат од 17,9 до 3.200 човек-месеци, што е распон од 178×. Споредбената анализа SEAA 2013 на COCOMO II, SEER-SEM, SLIM и TruePlanning врз 51 реален проект утврдила MMRE од 50 до 100%. Една евалуација од 2023 година врз збирот податоци COCOMO NASA утврдила MMRE близу 1,0 и PRED(0.25) = 0,0: ниту еден проект не бил проценет во рамките на опсегот на грешка од 25%. Моделите никогаш не биле дизајнирани за проект развиван со помош на ВИ. Но големината на јазот, дури и кога ќе се земе предвид неточноста на моделите, ни кажува дека нешто структурно се променило.
Што навистина велат истражувањата за агентската ВИ и продуктивноста на развивачите
Бројката 4.240× е екстремна и не сакам да ја преувеличувам. Изградбата на нов проект од нула ги надувува промените во кодот, а SLOC е слаб показател за вредноста. Затоа да ја погледнеме рецензираната литература. Асистентите од типот Copilot носат скромни, но вистински придобивки. Peng и соработниците (2023) утврдиле дека развивачите што користат ВИ како програмерски партнер завршиле задача 55,8% побрзо (95% CI: 21 до 89%). RCT-студијата на Microsoft/Accenture/Fortune 100 (2025), најголемата досега, со n=4.867, утврдила 26% повеќе завршени задачи. Интерната RCT-студија на Google (2024) утврдила намалување на времето по задача од ~21%. Теренскиот експеримент на BIS/Ant Group (2024) измерил 55% поголем излез на код кај помладиот персонал. Искреното резиме: од 1,26× до 1,56× за соодветни задачи. Вистински, но не и преобразувачки. Агентската ВИ работи во поинаков режим. Прегледот на Devin од Cognition за 2025 година пријавил резултати кај клиентите од 10× при ETL-миграции, 14× при миграции на верзии на Java и 20× при безбедносни поправки. Nubank пријави 12× подобрување на ефикасноста и 20× заштеда на трошоците при рефакторирање на повеќе милиони линии код, претходно проценето како повеќегодишен напор на илјада инженери. Нашата имплементација е токму во овој опсег: хистограмот на комитите покажува густи изливи во 22:00, 00:00 и 01:00 часот, што е потпис на сесии водени од агенти. Спротивните докази се вистински. RCT-студијата на Metr.org од 2025 година (16 искусни развивачи, 246 задачи на зрели проекти) утврдила дека ВИ го зголемила времето за завршување за 19%: ги забавила искусните развивачи на познати кодни бази. Студија од 2026 година со методот „разлика во разликите“ врз 807 GitHub-репозиториуми што усвоиле алатки со ВИ (He и соработниците, MSR ’26) утврдила „минливо“ зголемување на брзината и „трајно“ зголемување на сложеноста на кодот, што довело до долгорочно забавување. Насловот кажува сѐ: Speed at the Cost of Quality. Консензусот: ВИ многу помага при нов развој од нула и при структуриран развој, скромно помага при задачи за дополнување код и може да ја намали брзината на зрели кодни бази. Долгот во квалитетот е вистински.
Зошто моделите паѓаат: три структурни промени
Ниту еден од факторите на трошоци во класичните модели нема поставка за „развивачот има автономен агент што никогаш не спие и ја држи целата кодна база во контекст“. Три промени ја урнуваат кривата на времетраењето:
- Тесното грло на пишувањето исчезна.
Моделите претпоставуваат дека значителен дел од трудот е механички: шаблонски код, скелети, повторливи рефакторирања, ресурси за локализација и други структурирани податоци. Во оваа имплементација, голем дел од обемот е многу правилен текст и поврзување што агентот може масовно да го генерира или трансформира. Самиот рачно пишуван код (скелети, конструктори, лепило за платформите) сега се генерира во изливи, а не се пишува линија по линија.
- Трошокот за префрлање меѓу контексти се урива.
Човек што се префрла меѓу протоколскиот слој, слојот за податоци и механизмот за рендерирање плаќа данок за вчитување на контекстот секој пат. Агент што го прочитал целиот репозиториум од 672 датотеки го плаќа само еднаш. Таа асиметрија брзо се натрупува кај кодна база со оваа големина.
- Календарот повеќе не е тесното грло.
Моделите ги претвораат човек-месеците во календарски месеци преку равенка за ангажирање кадар што претпоставува човечки работен ден. Сесиите со агенти работат преку ноќ. Хистограмот на комитите покажува постојан излез од 07:00 до 01:00 часот: 18 активни часа, а не 8.
Емпириска калибрација врз работата на истиот автор
Параметарските модели се разминуваат за неколку редови големина, па спроведов и емпириска калибрација меѓу проекти, споредувајќи ги сопствените промени во кодот по човек-ден пред и по усвојувањето на алатка за агентска ВИ, на три други продукциски репозиториуми од истиот екосистем:
| Проект | Промени/ден пред ВИ | Промени/ден со ВИ | Мултипликатор |
|---|---|---|---|
| Проект А (балансер на оптоварување) | 673 | 2.056 | 3,1× |
| Проект Б (услуга за извештаи) | 239 | 2.127 | 8,9× |
| Проект В (услуга за обработка) | 1.322 | 982 | 0,7× |
| Збирно (просек / медијана) | н/п | н/п | 4,2× / 3,1× |
Истиот автор, истиот домен, вистинска работа на одржување. Емпирискиот мултипликатор е од 3× до 9×, многу поконзервативен од бројката 4.240× за нов развој од нула и во согласност со горниот крај на објавените истражувања за агентската ВИ. Еден проект всушност станал побавен: придобивките зависат од задачата и не се универзални.
Што значи ова за планирањето проекти
Ако сѐ уште ги проценувате софтверските проекти со некалибрирани модели и со основа од 25 SLOC на ден, при работа со помош на ВИ ќе згрешите за еден до три реда големина. Еве што правиме во RIADVICE:
- Калибрирајте според сопствената историја. Споредете го сопствениот излез на код по човек-ден со и без ВИ. Тоа е поевтино, поискрено и дава опсег од 3× до 9× што можете да го одбраните во проектниот план.
- Одделете го новиот развој од одржувањето. Мултипликаторот на агентската ВИ е најголем при нов развој од нула и при структуриран развој, а најмал (понекогаш и негативен) при одржување на зрели кодни бази. Не применувајте еден број за двете.
- Предвидете буџет за долгот во квалитетот. Брзината со ВИ доаѓа со трајно зголемување на сложеноста. Планирајте фаза на зацврстување и следете ја со метрики: следете ја цикломатската сложеност и извршувајте откривање на копиран код при секое издание.
- Проценувајте ја целата крива, а не само нејзиниот почеток. Зголемување на брзината од 10× што ја удвојува густината на дефекти не е зголемување од 10×: тоа е распоред повлечен нанапред по цена на подолг период на стабилизација.
Заклучок
Проект за кој секој модел за проценка вели дека треба да трае од 7 месеци до 47 години стигна до алфа-верзија подготвена за тестирање за 7 дена. Медијаната на мултипликаторот од 4.240× не треба да стане ничиј проектен план. Но таа е јасен сигнал дека времетраењето на сложениот развој на софтвер повторно се збива под дејство на истата сила што го збива трудот. Објавените истражувања покажуваат дека ВИ носи сѐ од побуда од 1,26× до скок од 20×, со реален ризик од негативен поврат на зрели кодни бази и со мерлив данок врз квалитетот. Моделите што ни кажуваа дека овој проект треба да трае децении се истите модели што и денес работат во корпоративните табели за проценка. Прашањето не е дали агентската ВИ го менува времетраењето на проектите: истражувањата веќе одговорија на тоа. Прашањето е дали вашата практика на проценување ги стигнала доказите. Ако вашите бројки сѐ уште доаѓаат од модел од 1981 година, калибриран врз COBOL и асемблер, време е за повторна калибрација, или барем да престанете да му верувате на календарот што го печати.
„Сѐ уште има значителен простор за подобрување за подобро да се одговори на предизвиците на предвидувањето со кои се соочува праксата.“
Accuracy of Contemporary Parametric Software Estimation Models, SEAA 2013
🏆 Доверлива инженерска и облачна експертиза
RIADVICE: вашиот доверлив партнер во софтверското инженерство
Дизајнираме, градиме и имплементираме сложени софтверски системи со инженерската дисциплина и алатките потребни за испорака во ерата на ВИ: навреме, во рамките на буџетот и со квалитет.
Дознајте повеќе за нашите услуги →
📚 Извори и дополнително читање
Оваа статија се потпира на рецензирани истражувања, рандомизирани контролирани испитувања и индустриски теренски извештаи за продуктивноста во развојот на софтвер со помош на ВИ и за проценката на трудот во развојот на софтвер:
- Студии за продуктивноста со ВИ (RCT-студии и теренски експерименти)
- Peng, S., Kalliamvakou, E., Cihon, P., & Demirer, M. (2023). The Impact of AI on Developer Productivity: Evidence from GitHub Copilot, arXiv:2302.06590: 55,8% намалување на времето за завршување на задачата
- Cui, R., et al. (2025). The Effects of Generative AI on High-Skilled Work: Evidence from Three Field Experiments with Software Developers Microsoft Research: n=4.867, +26,08% завршени задачи
- Dam, S., et al. (2024). How much does AI impact development speed? An enterprise-based randomized controlled trial, arXiv:2410.12944: RCT-студија на Google, n=96, ~21% намалување на времето по задача
- Becker, B., et al. (2025). Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity Metr.org: RCT-студија, n=16, 246 задачи; ВИ го зголемила времето за завршување за 19%
- He, H., Miller, C., Agarwal, S., Kästner, C., & Vasilescu, B. (2026). Speed at the Cost of Quality: How Cursor AI Increases Short-Term Velocity and Long-Term Complexity in Open-Source Projects, arXiv:2511.04427: студија со методот „разлика во разликите“ врз 807 GitHub-репозиториуми; MSR ’26
- Evolver Business Solutions (2026). For a few tokens more: The productivity effect of AI tools on software development tasks Репликација со наод од +13% (статистички незначаен)
- Индустриски извештаи за агентската ВИ
- Cognition AI (2025). Devin’s 2025 Performance Review: Learnings From 18 Months of Agents At Work 10× при ETL-миграции, 14× при миграции на Java, 20× при безбедносни поправки
- Nubank / Cognition. How Nubank refactors millions of lines of code to improve engineering efficiency with Devin 12× во инженерски часови, 20× заштеда на трошоците при рефакторирање на повеќе милиони линии код
- BIS / Ant Group (2024). Теренски експеримент; +55% излез на код, концентрирано кај помладиот персонал
- Проценка на трудот во развојот на софтвер: основи и точност
- Boehm, B. W. (1981). Software Engineering Economics. Prentice Hall: оригиналниот COCOMO
- Boehm, B. W., Abts, C., & Chulani, S. (2000). Software Cost Estimation with COCOMO II. Prentice Hall: калибриран врз 161 проект
- SEAA 2013. Accuracy of Contemporary Parametric Software Estimation Models COCOMO II, SEER-SEM, SLIM, TruePlanning врз 51 проект; MMRE од 50 до 100%
- Kemerer, C. F. (1993). An empirical validation of software cost estimation models, Communications of the ACM
- Nguyen, V., et al. (2019). Determining relevant training data for effort estimation using window-based COCOMO calibration Калибрација заснована на прозорци врз 341 + 93 проекти
- Ahmad, M., & Wani, M. A. (2023). Evaluation of COCOMO Model Accuracy in Software Effort Estimation MMRE ~1,0, PRED(0.25) = 0,0
- Putnam, L. H. (1978). A general empirical solution to the macro software sizing and estimation problem. IEEE TSE: моделот Putnam/SLIM
⚡ RIADVICE.com нуди доверливо инженерство, облачна експертиза и софтверски решенија од корпоративно ниво: навреме, во рамките на буџетот и со квалитет.





