Де людина знову дорожча за агента: $0,94 проти $24,79 за задачу на SWE-bench — крива витрат із прихованим хвостом верифікації

Усі питають, кого звільнити першим. Неправильне питання. Ось крива, на якій агент у 96× дешевший — і точка, де він раптом дорожчий за людину.

Конвеєр задач, що тягнеться вправо: ліворуч роботизовані руки штампують однакові деталі, праворуч одна людина за пультом тримає табличку з підписом над останнім вузлом — там, де крива витрат загинається вгору.
У цій публікації
  1. Питання, яке всі ставлять не з того кінця
  2. Спочатку чесно: де агент розчавив людину і не віддасть
  3. А тепер увімкни лампу над рахунком
  4. Дешевий токен, дорогий результат — пастка №1
  5. Помилка, що множиться: пастка №2
  6. Парадокс верифікатора — серце Лінії останнього найму
  7. Парадокс бенчмарку — чому твій кейс не схожий на демо
  8. Лінія Мажино для найму
  9. Останній найманий

Питання, яке всі ставлять не з того кінця

Ніч над Атлантикою, шоста година польоту. Cockpit темний, обидва пілоти не торкаються штурвала — система веде борт сама: курс, висота, швидкість. І авіакомпанія платить їм повну зарплату. За шість годин сидіння? Ні. За ті 90 секунд, коли система скаже «я пас» і борт провалиться в ситуацію, якої в датасеті не було. Пілот платний не за те, що тримає кермо, — за те, що тримає підпис під тим, що станеться, якщо кермо відмовить.

Автопілот веде сучасний пасажирський літак понад 90% часу польоту. Екіпаж із двох пілотів коштує авіакомпанії сотні тисяч доларів на рік і нікуди не зник — навіть коли машина забрала майже весь штурвал. Автоматика не забрала жодного грама відповідальності: вона перенесла його в інше місце, на крісло поряд. Важлива поправка: цю межу в авіації тримає ще й регуляція, не лише ринок. Тож аналогія описує структуру — виконання окремо, відповідальність окремо, — а не точну економіку. Бери її як образ, не як рівність.

Це і є Лінія останнього найму — поки лише як обіцянка. Повне визначення попереду.

Той самий розподіл праці є в кожному домі, де росте дитина. Няня не заважає дитині бути обдарованою — вона просто стоїть у дверях і знає: талант не знімає відповідальності з дорослого. У кабіні цю роль звуть другим пілотом. У бюджеті компанії — статтею «додатковий персонал». В обох випадках робота однакова: стояти поруч і бути готовим сказати «ні» раніше, ніж стане пізно.

Тепер поверни голову до AI-дискусії 2025–2026 років. Що обговорюють? «Кого звільнити першим?» Скільки робочих місць зникне, котрий відділ порізати. Питання зрозуміле — і неправильне. Не тому що жорстоке. Тому що дивиться у хвіст хвилі, коли вона вже пройшла. Правильне питання звучить інакше: кого ти найняв би останнім, якби рахував чесно? Бо ця людина — не жертва автоматизації. Вона її найдорожчий побічний продукт.

Чому саме зараз? Тому що це питання більше не риторичне — воно вже в посадових інструкціях. У квітні 2025-го Тобі Лютке, CEO Shopify, розіслав співробітникам меморандум: перш ніж просити нову людину в команду, доведи, чому цього не може зробити AI. Питання про використання AI лягло в перформанс-рев’ю поруч із KPI. Це більше не футурологія конференцій — це рядок у службовій записці, яку читає конкретний менеджер перед тим, як підписати заявку на найм.

Межа між «агент дешевший» і «людина дешевша» — не горизонталь. Вона вигнута, і в неї є прихований хвіст, якого більшість фаундерів не бачать у своїй таблиці витрат. Поки не приходить місячний рахунок.


Спочатку чесно: де агент розчавив людину і не віддасть

Кол-центр медичної страхової компанії, нічна зміна, двісті операторів, один і той самий скрипт сотні разів на добу. Компанія ввела AI-агента. Нікого не звільнили. Просто перестали наймати назад тих, хто йшов. За рік — мінус 120 позицій. Тиха крапля, що стала тихим потопом. HR це назве природним відтоком. Природа тут ні до чого — відтік був суто штучний, з приставкою «інтелект». Ось так це відбувається: не шумно, не публічно, без пресрелізу. «CEOs will quietly stop hiring, then replace humans with AI the moment it becomes viable to do so — almost overnight», — сказав Dario Amodei в травні 2025-го Axios. Ключове слово — «quietly».

У цій історії є персонаж без імені й без наказу про звільнення — Нічний Бухгалтер Вакансій. Він нікого не звільняє. Він просто не тисне «опублікувати» на новій вакансії. Єдиний його жест — закрита вкладка браузера о восьмій вечора.

На рутині рахунок давно закритий. За бенчмарками Freshworks і Salesforce, AI-агент обробляє стандартний тікет підтримки приблизно за $0.50, людина-оператор — за $6 у тій самій взаємодії. Різниця приблизно в 12 разів на одній одиниці роботи. Це не тренд і не прогноз — це операційна реальність, яка фіксується в P&L щоквартально. І рахунок цей рахується не на одній взаємодії, а на сотнях тисяч: кол-центр на двісті операторів закриває мільйони тікетів на рік, і кожен помножений на десятикратну різницю — це вже не економія, це інша бізнес-модель.

На кодових задачах ще різкіше. Препринт «How Do AI Agents Do Human Work? Comparing AI and Human Workflows Across Diverse Occupations» (arXiv 2510.22780, жовтень 2025, не рецензований) порівнює вартість задачі на SWE-bench: агент OpenHands з GPT-4o — $0.94 за задачу, людська база у самій статті — близько $24.79 за задачу, тобто понад 96% скорочення вартості. На іншій конфігурації — Claude Sonnet 4 — та сама задача коштувала $2.39, тобто все ще понад 90% економії проти людини. Уточнення важливе: це бенчмарк, закрита задача з правильною відповіддю, а не реальний production, і це препринт без рецензування. Але навіть із цим застереженням ця категорія задач уже не повернеться до людини. Економічна крива зламалась остаточно.

І тут варто покласти на стіл найчесніше число з академії — те, що рідко цитують ентузіасти автоматизації. Команда MIT FutureTech під керівництвом Ніла Томпсона (Maja Svanberg, Wensu Li, Martin Fleming, Brian Goehring; робоча стаття «Beyond AI Exposure: Which Tasks are Cost-Effective to Automate with Computer Vision?», 2024) порахувала: серед задач, пов’язаних із зоровим сприйняттям, лише близько 23% компенсації працівників економічно привабливі для автоматизації, якщо чесно врахувати вартість впровадження. У решті 77% людина дешевша — просто тому, що поставити, навчити й утримувати систему коштує більше за зарплату. Важлива межа: це дослідження стосується саме computer vision, а не всього ринку праці, і узагальнювати його на «усі задачі» було б тим самим самообманом, який ми тут препаруємо. Але напрямок воно показує точно: навіть там, де технічно можливо, економічно виправдано далеко не завжди.

Для рутини зі скриптом, для закритих задач із правильною відповіддю, для обсягу, що вимірюється тисячами тікетів, — агент виграв. Не «скоро виграє». Виграв. І тут немає луддизму — тут математика.

Питання в тому, що відбувається праворуч від цієї точки.


А тепер увімкни лампу над рахунком

Операційний директор стартапу. 23:50. Відкрита вкладка AWS Billing Console. Сума за токени за місяць — $47,000. Це приблизно річна зарплата одного junior developer у Польщі. Агент писав листи клієнтам. Гарно писав — чітко, вчасно, персоналізовано. Точнісінько так само гарно, як у лютому 2024-го писав чат-бот на сайті Air Canada: клієнту на ім’я Джейк Моффат, що летів на похорон бабусі, бот впевнено пообіцяв знижку на bereavement-тариф і назвав точні умови повернення грошей. Умови бот вигадав. Air Canada відмовила в поверненні, а потім, у трибуналі Британської Колумбії, спробувала аргумент «за слова бота відповідає бот, а не компанія». Трибунал такого розмежування не визнав: компанія відповідає за все, що написано на її сайті, включно з тим, що написав алгоритм. Моффату присудили близько 650 канадських доларів. Сума смішна. Прецедент — ні: лист, що йде в суд, агент не відрізняє від листа, що йде в inbox, а компанія відповідає однаково за обидва.

Bryan Catanzaro, VP Applied Deep Learning у Nvidia, сказав публічно (Fortune, 28 квітня 2026): для його команди AI-обчислення вже коштують більше, ніж зарплати співробітників. Не «наближаються». Вже перетнули межу. Nvidia сама виробляє GPU — якщо хтось і знає реальну вартість обчислень, то це вони. Показово: того самого місяця стало відомо, що великі техкомпанії сукупно заклали в AI близько $740 млрд у 2026-му — на 69% більше, ніж роком раніше. Це не стартап, що переоцінив бюджет. Це вся індустрія, що робить ту саму ставку одночасно. Тут потрібна одна тверезяча поправка: команда Catanzaro — це R&D з нетиповим, важким workload, не середній бек-офіс. Але саме тому його слова важать більше, а не менше: якщо навіть виробник чіпів дивиться на власний рахунок і бачить, що кремній обігнав людину, — то припущення «обчислення майже безкоштовні» треба викидати з кожної таблиці.

Chamath Palihapitiya пішов далі. За його підрахунками, агент мусить бути щонайменше вдвічі продуктивнішим за людину, яку замінює, щоб просто виправдати токен-витрати плюс нагляд — «they need to be at least twice as productive as another employee». Не на 10% кращим. Удвічі. Бо різницю з’їдає інфраструктура, prompt engineering і людина, яка все одно сидить поряд і перевіряє. Його стартап 8090, за його словами, бачив, як AI-рахунок більш ніж потроївся з листопада 2025-го й прямує до $10+ млн на рік — і це людина, яка будує бізнеси саме на цій хвилі, а не критик збоку.

Ось де рахунок починає гнути в інший бік.

Та сама модель — дешевий виконавець і дорогий наглядач одночасно; усе залежить від того, де ти стоїш у ланцюжку.

Більшість компаній рахує так: «ми платили $X людині, тепер платимо $Y агенту, Y менший за X, економія». Це порахував Бухгалтер без Ліхтарика — він світить точно на зарплатну відомість і жодного люмена не залишає під стіл, де лежать токени, інфраструктура, prompt engineering, моніторинг і людський нагляд. Він не рахує помилку, яку агент зробить, а людина помітить. Або не помітить — і тоді рахунок буде не в Billing Console, а в трибуналі Британської Колумбії. Колонка «зарплата» видима й болить щомісяця; колонка «прихований нагляд» невидима й болить раз — але одразу на всю суму.

Конвеєр задач із роботизованими руками, що штампують однакові деталі під лампою


Дешевий токен, дорогий результат — пастка №1

Термінал відкритий поруч із калькулятором на телефоні. Інженер додає ще один нуль до прогнозу місячного бюджету на токени, тре очі, перераховує вручну — формула та сама, відповідь та сама.

Є красивий аргумент: Gartner у березні 2026-го прогнозує, що вартість інференсу для LLM на трильйон параметрів впаде більш ніж на 90% до 2030-го — вдесятеро дешевший «мозок» за той самий проміжок. Отже, все дешевшає, межа зсунеться. Ось тільки той самий звіт Gartner ставить поруч другу цифру, яку рідко цитують ті, хто пересилає далі перший заголовок: агентні системи споживають у 5–30 разів більше токенів на задачу, ніж стандартний чат-бот. І висновок — не мій, Gartner-івський, чорним по білому: сукупна вартість інференсу швидше зросте, ніж впаде, бо споживання токенів росте швидше за їхнє здешевлення.

У кожному прайс-листі на AI живе Продавець Першої Цифри: він показує знижку на вході й ніколи не веде тебе до каси, де стоїть друга цифра — обсяг споживання. Це як знижка «−50%» в супермаркеті на товар, чий чек у підсумку більший, ніж торік: цифра на бирці правдива, цифра в чеку — теж, просто це різні цифри.

Для прикладу: базовий одноразовий запит може коштувати лічені центи, а складний агентний ланцюжок із reasoning-петлями, зверненнями до інструментів, кількома кроками валідації — долар і більше. Десятки разів дорожче на тій самій моделі. І це не аномалія — це архітектурна властивість агентних систем. Що «розумніший» агент, то довший його thought process, то більше токенів він спалює на внутрішнє міркування, перш ніж зробити крок. Парадокс жорстокий: кожне покоління моделей робить один токен дешевшим — і одночасно вчить агента витрачати їх більше, бо «думати довше» тепер дає кращу відповідь. Дешевшає цеглина, дорожчає будинок.

Self-correcting агент — окремий клас. Він спавнить суб-агентів на підзадачах, кожен з яких теж думає, теж перевіряє, теж генерує. Один такий ланцюжок на єдиній задачі здатний спалити в 10–50 разів більше від очікуваного бюджету. Jason Calacanis розповів CIO.com (3 квітня 2026-го): витрати на Claude API в одному з його проєктів злетіли до $300 на день — і сформулював межу різкіше за будь-якого аналітика: «When do tokens outpace the salary of the employee? Because you’re about to hit it» (коли токени переганяють зарплату співробітника? бо ти якраз до цього наближаєшся). Порахуй сам: $300 на день — це майже $110,000 на рік, зарплата не молодшого спеціаліста, а сеньйора з досвідом. У тому ж матеріалі інженер Шахрам Анвер порівнює вартість агента з повністю навантаженою зарплатою сеньйор-SRE — понад $200,000 на рік. Коли простий агент наближається до цієї стелі, питання «навіщо нам агент» перестає бути риторичним.

Ніхто не дивиться — бо агент не спить. Це його головна перевага і головна пастка одночасно. Він генерує об’єм, який жоден людський менеджер не відслідковує вручну. Людина-аналітик, спаливши денний бюджет до обіду, зупиниться й спитає себе, чи туди він копає. Агент о третій ночі цього питання собі не ставить — у нього немає ні обіду, ні сумніву, ні рахунку перед очима. Він просто продовжує. І саме тому рахунок приходить місяць потому — вже незворотним.

Є ще одна тонкість, яку маркетингові графіки «токен дешевшає» приховують. Падіння ціни рекламують на базовій моделі — а production-навантаження дрейфує вгору по класах. Сьогодні задачу закриває дешева модель, завтра під неї підкручують reasoning-режим, бо «так точніше», післязавтра додають retrieval і другу модель-критика. Кожен такий апгрейд купується за обіцянку якості — і кожен непомітно перекладає навантаження на дорожчий тариф. Лінія прайс-листа повзе вниз; лінія твого рахунку повзе вгору; перетинаються вони рідко.

Математика виходить проста: якщо токен дешевшає на 90%, а агент споживає в 30 разів більше, то результат за результат не дешевшає. Він може дорожчати — якщо складність моделей зростає швидше за здешевлення чіпів.


Помилка, що множиться: пастка №2

Агент пише маркетинговий аналіз. Крок 1 — збирає дані. Крок 3 — агрегує по компаніях, і саме тут плутає дві організації зі схожими назвами: в одній повній назві відрізняється одне слово. Галюцинація крихітна — одна заміна в таблиці. Але на кроці 5 агент «підтверджує» дані перехресними джерелами. На кроці 7 — будує висновки. Неправильний «факт» тепер лежить у трьох окремих висновках, кожен з яких посилається на попередній. Директор з маркетингу підписує фінальний звіт — бо перевіряє логіку, а не первинні дані. Клієнт читає. Конкурент читає теж.

Феномен compounding errors добре задокументований у дослідженнях агентних систем, і суть його безжальна: у мультикрокових агентних ланцюжках помилки не додаються — вони перемножуються, тож ланцюжок ламається частіше, ніж підказала б сума per-step ризиків. Порахуй на пальцях: якщо кожен крок надійний на 95%, то десять кроків поспіль дають уже не 95%, а близько 60% — бо 0.95 у десятому степені. Дев’ять кроків спрацювали бездоганно, а ланцюжок усе одно зламався — і це не баг конкретної моделі, це арифметика послідовності.

У червні 2023-го цей механізм отримав ім’я в залі суду. Юрист Стівен Шварц просив ChatGPT знайти прецеденти для позову проти авіакомпанії Avianca. Бот згенерував шість дуже переконливих справ: назви, дати, цитати суддів. П’ять із шести ніколи не існували. Шварц вставив їх у офіційний бріф під власним підписом і чесно зізнався судді Кевіну Кастелу, що діяв «під хибним враженням, ніби ChatGPT не здатен сам вигадувати справи». 22 червня 2023-го суд оштрафував Шварца, його колегу Пітера ЛоДуку й саму юридичну фірму на $5,000. Сума — кишенькові гроші для юрфірми. Урок — ні: у документі з підписом людини галюцинація виглядає так само, як факт, доки хтось не відкриє першоджерело.

Ось чому помилка на кроці 3 і факт на кроці 7 — не одне й те саме, хоч виглядають однаково. Це не пляма, яку змиває наступна ітерація. Це метастаза: до кроку 7 вона встигає прорости у три окремі висновки, кожен з яких тепер посилається на два інші як на незалежне підтвердження. Вирізати її одним рухом уже не можна — доведеться оперувати всі три органи звіту одразу, і хірург, якого викликають на цю операцію, коштує значно дорожче за консиліум, що пропустив діагноз на вході.

Це вже другий раз у цьому тексті, коли авіакомпанія стає піддослідним кроликом AI-галюцинації. Спершу бортовий чат-бот вигадав знижку на похорон бабусі. Тепер юридичний чат-бот вигадав самих суддів. Небо, схоже, не єдине, що в цій індустрії штучне.

Головний механізм: людина в ланцюжку помітить помилку раніше, ніж вона розмножиться. Аналітик, який бачить, що дві компанії в таблиці — насправді одна, спіткнеться на цьому інстинктивно, бо в нього є модель реальності поза документом. Агент — ні, бо в нього немає «відчуття», що щось не так. У нього є лише вихід попереднього кроку й наступний промпт. Помилка виглядає як будь-яка інша інформація — рівно та сама вага, той самий шрифт, та сама впевненість.

Маркетинговий звіт, у якому одна крихітна заміна розповзається в три висновки


Парадокс верифікатора — серце Лінії останнього найму

Ось де термін клацає на місце.

Лінія останнього найму — це не горизонталь, за якою люди закінчуються. Це крива витрат із прихованим хвостом: що ближче задача до контексту, судження й підпису під наслідком — то дорожчий наглядач, і то ближче людина знову до центру рахунку. Агент не замінює людину — він переміщає її ліворуч по конвеєру, до перевірки. А верифікатор на складній задачі може коштувати дорожче за виконавця, якого він перевіряє.

Розгорни це не в теорії, а на прикладі, який усі бачили в стрічці. У лютому 2024-го Klarna оголосила: її AI-асистент за перший місяць закрив 2.3 мільйона розмов — за обсягом це робота приблизно 700 повних ставок підтримки. Час вирішення впав з 11 хвилин до менш ніж двох. Компанія прогнозувала $40 млн додаткового прибутку за рік. Це був не піар — це були цифри, які реально показували графіки. А тоді, у травні 2025-го, CEO Себастіан Сім’ятковські сказав Bloomberg те, що конкуренти досі лише шепочуть: якість впала, бо вартість була «занадто домінантним фактором оцінки» рішення, і компанія тихо почала набирати людей назад — саме на складні, «преміальні» звернення, ті, де клієнт роздратований, ситуація неоднозначна або пахне репутаційним ризиком. Рутинний шар лишився за AI. Судженнєвий шар повернувся до людей. Klarna не помилилась із математикою тікета. Вона помилилась із визначенням, де саме проходить межа рутини.

Розгорни це й на іншому кінці спектра. Зовнішній фінансовий аудит — одна з найбільш регульованих і відповідальних функцій у корпоративному світі. LLM справді корисні для рутинних робочих паперів: систематизація документів, первинна перевірка відповідності стандартам, форматування звітів. Але там, де потрібне аудиторське судження — інтерпретація специфічних обставин, оцінка виключень, рішення про суттєвість порушення, — дослідники аудиторських LLM незалежно приходять до одного висновку: моделі «insufficiently robust» — недостатньо надійні для практичного судженнєвого застосування. Через галюцинації, застарілі дані, відсутність контексту конкретної організації і, головне, через відсутність відповідальності. Уяви картину: партнер аудиторської фірми ставить підпис під висновком, який потім читатимуть регулятор, інвестор і, можливо, суд. Цей підпис — особиста відповідальність людини, яка ризикує ліцензією і репутацією. Агент не має ні ліцензії, ні репутації, ні чим ризикувати. Він може підготувати дев’яносто відсотків паперу — але останні десять, ті, де ставиться підпис, лишаються людськими не через технічну слабкість моделі, а через те, що відповідальність неможливо завантажити в контекстне вікно.

І ось парадокс, якого більшість фаундерів не бачать у своїх планах автоматизації: щоб зекономити на людині-виконавці, потрібна людина-верифікатор. На простих задачах верифікатор дешевий — людина бачить рутину й підтверджує швидко. Але що складніша задача, то дорожчий потрібен верифікатор — з більшим контекстом, більшим досвідом, більшою відповідальністю. І на певній точці кривої вартість верифікатора перекидає рахунок: дешевше найняти людину-виконавця з відповідальністю, ніж агента плюс дорогого людського наглядача.

Це і є крива Лінії останнього найму:

Категорія задачВиконавецьВерифікаторДе рахунок?
Рутинний CS (тікети, скрипти)Агент $0.50/тікетМінімальнийАгент виграв назавжди
Кодові задачі (закриті, benchmark)Агент $0.94/задачаЧастковийАгент виграє на масштабі
Аналіз даних (середня складність)Агент + петліСередній, людинаЗалежить від ціни помилки
Юридичні, медичні, аудитАгент (допоміжна роль)Дорогий спеціалістЛюдина дешевша на підпис
Стратегія, судження, відповідальністьНе автоматизуєтьсяНемає кому делегуватиЛюдина — і це навмисно

Прочитай таблицю згори вниз — і побачиш, як колонка «верифікатор» важчає рядок за рядком, поки врешті не з’їдає всю економію виконавця. У першому рядку наглядач майже безкоштовний; у передостанньому він — найдорожча людина в кімнаті. Це і є хвіст кривої, винесений у клітинки.

Підстав сюди свою команду. Знайди задачу, яку ти зараз хочеш віддати агенту, і чесно поклади її в один із рядків: скільки коштує помилка, коли (не якщо) вона трапиться, і хто саме — з іменем, посадою, підписом — відповідає за наслідок. Якщо на це запитання нема відповіді, ти не автоматизуєш задачу. Ти ховаєш відповідального.

І ще одна річ, яку зручно не помічати: верифікаційна премія захищає не найкращих суддів, а найбільш інституційно легітимних. Ліцензований аудитор-партнер із двадцятирічним стажем і толковий двадцятишестирічний аналітик без диплома можуть мати однаково гостре чуття на фальшиву цифру в звіті — але тільки перший має підпис, який щось важить для регулятора, суду й страховика. У Shopify квітня 2025-го це формалізовано буквально: молодший спеціаліст мусить довести, чому AI не впорається, перш ніж йому дадуть ресурс. Старший — рідко мусить щось доводити, бо його підпис і є ресурс. Демократично: агент теж не має підпису. Просто йому й не потрібне перформанс-рев’ю, щоб це довести. Межа рухається праворуч не за компетентністю. Вона рухається за статусом, який має право підписати.

Показово, хто вже почав рахувати цю ціну офіційно: у травні 2025-го синдикати Lloyd’s of London вперше застрахували AI-агента як окреме джерело ризику — поліс Armilla Insurance, що явно покриває вартість помилок чат-бота. Ринок, якого два роки тому не існувало, тепер виставляє premium там, де компанії досі рахують «економію».

Тут і ховається нянька, з якої почався цей текст. Агент — обдарована дитина: може розважити гостей, порахувати, написати лист, навіть блискуче. Але коли дитина щось ламає, у суд, до трибуналу, до страховика йде не дитина. Йде дорослий, що стояв у дверях. Верифікатор — це і є той дорослий: у бюджетній таблиці він проходить рядком «нагляд», непродуктивна стаття, накладні витрати. У реальності він — єдина людина, яка коштує системі того, що система коштує.

За даними Forrester (Enterprise AI Cost Analysis, 2025), середній співробітник витрачає близько 4.3 години на тиждень на перевірку AI-виходів — приблизно $14,200 на рік прихованого overhead на одну людину. Це платне дослідження за paywall, тож пряма верифікація обмежена, але джерело репутаційне. Порахуй ефект масштабу: на компанію в 500 людей це $7.1 млн на рік — витрачених на перевірку домашнього завдання агента ще до того, як хоч один результат вийде за двері. Навіть якщо цифра завищена — сам феномен системний: verification overhead існує, він росте разом зі складністю задач, і він ніколи не з’являється у колонці «витрати на AI» у презентації для борду.

Тут варто зупинитись і назвати несучий механізм прямо, щоб він не загубився в деталях. Звучить він так: verification overhead — це ціна, яку платить система за кожного агента, якому довіряє без права підпису. Що менше в агента відповідальності, то більше людина має бути поруч. І ця людина — не асистент і не оператор. Це і є останній найманий.


Парадокс бенчмарку — чому твій кейс не схожий на демо

Друга ночі. Одинадцять вкладок відкрито — половина Cursor, половина stripe.com/billing. За даними CIO.com (квітень 2026), один користувач власним коштом перевірив, скільки коштує «обережний» персональний агентний воркфлоу: $500 за тиждень навіть при свідомо ощадливому підході. В іншому місці того самого матеріалу фонову агентну задачу порівняли з вартістю сеньйор-SRE на повному навантаженні — понад $200,000 на рік. Агент обійшовся дорожче. Але агент не спить. І саме тому ніхто й не дивився на лічильник, поки рахунок не прийшов.

Бенчмарк — закрита задача з правильною відповіддю. Реальний бізнес — відкрита задача без правильної відповіді і з ціною помилки.

На SWE-bench, де тести чіткі, агент дешевший на два порядки. На реальному production-проєкті з ambiguous requirements, legacy codebase і клієнтом, що змінює вимоги щотижня, рівняння інше. Не тому що модель гірша. Тому що задача інша по суті. На бенчмарку є зелена галочка, яка каже «правильно». У production такої галочки немає — є тільки клієнт, який через три тижні скаже, що мав на увазі зовсім інше, і ніхто цього не знав на момент запуску агента.

Gartner (25 червня 2025-го) прогнозує: понад 40% агентних AI-проєктів будуть закриті до кінця 2027-го через неконтрольовані витрати, відсутність чіткого ROI і недостатні механізми контролю ризиків. Причина не в тому, що AI не працює. Причина в тому, що більшість проєктів — proof-of-concept, який ніколи не дійде до production з прийнятною економікою. Той самий Gartner ще в січні 2025-го опитав 3,412 учасників свого вебінару: лише 19% зробили значні інвестиції в агентний AI, 42% — обережні, 8% — жодних, а 31% просто чекають і дивляться. І свіжіший розрив, уже 2026 року: лише 17% організацій реально розгорнули AI-агентів, тоді як понад 60% обіцяють собі це «протягом двох років» — та сама фраза, якою тринадцять сезонів поспіль обіцяють собі абонемент у спортзал з понеділка. З тисяч вендорів, що декларують «agentic AI capabilities», реальні агентні можливості Gartner визнає лише за близько 130. Решта — «agentwashing»: стара автоматизація з табличкою «agentic» на дверях, рожевою фарбою поверх труби, яка вже лежить у болоті.

Незалежне підтвердження прийшло не з індустрії AI, а з MIT: дослідження NANDA «The GenAI Divide» (серпень 2025; 150 інтерв’ю з керівниками, опитування 350 співробітників, аналіз 300 реальних розгортань) показало, що 95% корпоративних генеративних AI-проєктів не дають жодного вимірного впливу на P&L — попри $30–40 млрд вкладених інвестицій. Цікавіше інше: рішення, куплені у спеціалізованого вендора, окуповуються приблизно у 67% випадків, а побудовані власними силами всередині компанії — лише в третині від цього показника. І поки офіційна статистика показує 40% компаній із ліцензованими LLM-підписками, 90% співробітників щодня тихцем користуються особистим ChatGPT чи Claude для робочих задач в обхід корпоративних процедур. Найбільша автоматизація в компанії часто відбувається не за рішенням CFO, а в приватній вкладці браузера, яку CFO ніколи не побачить.

Демо — це закрита задача, де агент виглядає блискуче. Твій кейс — відкрита задача, де ціна помилки вимірюється не рейтингом на leaderboard, а судовим позовом або клієнтом, що пішов до конкурента.

Парадокс бенчмарку — третій у списку після дешевого токена й мультиплікативної помилки — полягає ось у чому: успіх на бенчмарку показує стелю можливостей; він не показує підлогу реальних витрат. А рішення про автоматизацію приймають по стелі, а платять по підлозі.

Стіл фаундера о другій ночі: екран із лічильником API-запитів поряд із рахунком на оплату


Лінія Мажино для найму

Генерал із гордістю показує карту: суцільна лінія бетонних укріплень уздовж кордону. Артилерія, бункери, кілометри дроту. Найдосконаліша оборонна система свого часу — лінія Мажино. Будували її роками, на неї поклали мільярди й національну гордість. Вермахт пройшов через Арденнський ліс і обійшов її за чотири дні. Укріплення залишились непошкодженими — просто нікому не знадобились. Найдорожча у світі стіна, об яку ніхто не вдарився.

Чесна позиція вимагає сказати вголос: Лінія останнього найму не зафіксована на мапі. Вона рухається.

Токен дешевшає. Verification overhead — теж задача, яку частково автоматизують агенти-перевіряльники. Моделі покращуються не лінійно, а стрибками, і кожен стрибок переміщає межу праворуч — туди, де ще рік тому людина була незамінною. Хто будує стратегію на тезі «у складному людина завжди дорожча» — будує лінію Мажино: красиве укріплення, яке ворог обійде збоку.

На закритих задачах людина вже програла остаточно, і жоден сентимент цього не змінить. $0.94 за задачу — реальне число, не маркетинг. Хто ігнорує цей факт заради душевного спокою — той не готується, він просто заспокоюється.

Але ось де чесність і обмеження цього лонгріду.

Ми не знаємо швидкості зсуву. Verification overhead частково автоматизується — але «частково» і «повністю» — це різні рівняння. Перевіряти перевіряльника-агента все одно мусить хтось із підписом; ти можеш додати ще один шар автоматики, але право сказати «це йде в production» врешті впирається в людину, яка за це відповідає. Відповідальність, яку нема кому підписати, — не технічна проблема, а інституційна. Регулятори, суди, страхові компанії не приймають «модель вирішила» як юридично значимий підпис. І доки це так (а це може бути довго), правий хвіст кривої лишається людським не тому що люди кращі, а тому що так побудована система.

Навіть власні дані Anthropic (Economic Index, кінець 2025 — початок 2026) не дають однозначної відповіді на швидкість: частка розмов, класифікованих як «доповнення людини» проти «повна автоматизація», гойдається туди-сюди в районі 50/50 із кварталу в квартал — то одне випереджає, то інше. Якщо навіть компанія, що будує ці моделі, не бачить стійкого тренду у власних логах, довіряти чужому прогнозу «за три роки все» — це купувати впевненість там, де продають лише ймовірність.

Прогноз Amodei про «quietly stop hiring» — холодний душ проти самозаспокоєння. Але це заява CEO, а не теорема. Entry-level white-collar позиції зникатимуть швидко — це очевидно. А «50% за 1–5 років» — це прогноз із похибкою, яка вимірюється роками й мільйонами людей. Людина, яка повторює цю цифру як вирок, і людина, яка відмахується від неї як від ажіотажу, роблять однакову помилку: обидві вдають, що знають швидкість, якої не знає ніхто. Хто каже, що знає точну швидкість зсуву, найчастіше продає або підписку на курс, або паніку в заголовку. Часом — те й те одним рухом руки.

Єдина стала змінна в рівнянні — швидкість, з якою людина на правому краї кривої переучується й лишається правіше від межі. Лінія рухається. Людина теж мусить.


Останній найманий

Уяви компанію. Одна людина. Остання. Ти наймаєш її — і тільки її. Що вона робить?

Не пише тікети. Не генерує листи. Не агрегує дані. Все це робить агент. Вона робить одне: ставить питання «а що далі?» — і бере підпис під відповіддю.

Лінія останнього найму з’являлась у цьому тексті тричі: спершу як обіцянка в авіаційній аналогії, потім як механізм у парадоксі верифікатора, а тепер — як фінальна рамка. Вона не горизонталь, за якою люди закінчуються. Вона крива з прихованим хвостом: що дорожча помилка, то дорожчий наглядач, і то ближче людина знову до центру рахунку.

Тобі Лютке хотів прибрати з компанії зайві витрати. Вийшло рівно те, про що йдеться в цьому тексті: політика «доведи, що AI не впорається» найточніше б’є не по слабких виконавцях, а по молодших — тих, у кого ще немає підпису, що чогось важить. Старших це правило не лякає: їхній підпис і так дорожчий за будь-якого агента.

Фаундери, що автоматизують згори вниз — від стратегії до виконання, — зазвичай лишають «останнього» саме у виконанні. Операторів, технічних спеціалістів, людей, які «просто роблять». І виносять із компанії саме ту людину, яка тримала рахунок чесним: яка скаже «стоп, тут щось не так» до того, як агент відправить лист у суд. Яка має контекст, якого немає в жодному промпті. Яка несе особисту відповідальність — не за KPI, а тому що підписала.

Автоматизація знизу вгору дешевша лише в перші місяці. Автоматизація згори вниз, що прибирає людину з відповідальністю, дорожча за будь-який місячний рахунок AWS. Її ціна з’являється тоді, коли немає кому сказати «ні».

Агент порахує що завгодно. Він просто ніколи не спитає, чи правильне те, що ти попросив порахувати. Ось чому остання людина в компанії — не та, що лишилась, і не той агент, що зробив усе інше. Це нянька всього механізму: та, кого ти найняв би першою, якби колонка з прихованими витратами була у твоїй таблиці з самого початку.

Питання та відповіді

Що дешевше — AI-агент чи людина для рутинних задач?

Для чистої рутини агент виграє беззаперечно. За бенчмарками Freshworks і Salesforce — близько $0.50 за AI-взаємодію проти $6 за людську, це приблизно 12-кратна різниця в собівартості типового тікета. На закритих кодових задачах препринт «How Do AI Agents Do Human Work?» (arXiv 2510.22780, жовтень 2025) фіксує $0.94 за задачу для агента на GPT-4o проти $24.79 людської бази в тій самій роботі — 96% економії; на Claude Sonnet 4 — $2.39, це 90%. Це не повернеться до людини. Але «рутина» — рухома межа: у 2024-му Klarna вважала клієнтську підтримку суцільною рутиною й замінила її AI повністю, а в 2025-му тихо найняла людей назад, бо частина «рутинних» звернень виявилась емоційно і репутаційно навантаженою.

Чому AI-агент іноді коштує дорожче за співробітника, якого замінює?

Бо рахують лише зарплату людини, а не токени, інфраструктуру, prompt engineering і людський нагляд. Bryan Catanzaro, VP Applied Deep Learning у Nvidia, сказав Fortune (квітень 2026): «вартість обчислень для моєї команди вже далеко перевищує вартість співробітників» — і це на тлі того, що великі техкомпанії залили в AI близько $740 млрд у 2026-му, на 69% більше, ніж роком раніше. Chamath Palihapitiya (стартап 8090) каже: агент має бути щонайменше вдвічі продуктивнішим за людину, яку замінює, щоб окупити токени й нагляд, а його власний AI-рахунок більш ніж потроївся з листопада 2025-го й прямує до $10+ млн на рік. Jason Calacanis формулює гостріше: «Коли токени переганяють зарплату співробітника? Бо ти якраз до цього наближаєшся».

Чому дешевший токен не означає дешевший результат?

Бо Gartner у власному прогнозі (березень 2026) визнає парадокс: вартість інференсу для великої мовної моделі впаде більш ніж на 90% до 2030-го — і водночас агентні системи споживають у 5–30 разів більше токенів на задачу, ніж звичайний чат-бот, тож сукупний рахунок, за прогнозом того самого звіту, швидше зросте, ніж впаде. Дешевшає цеглина, дорожчає будинок.

Що таке прихована вартість верифікації AI?

Forrester (2025) оцінює: середній співробітник витрачає 4.3 години на тиждень на перевірку виходів AI — близько $14,200 прихованого навантаження на людину щороку; на компанію з 500 людей це $7.1 млн, які йдуть на перевірку домашнього завдання агента ще до того, як хоч один результат вийде за двері. Помилки в довгих ланцюжках не додаються — перемножуються: галюцинація на кроці 3 стає підтвердженим фактом на кроці 7.

Які задачі НЕ варто автоматизувати агентами?

Ті, де контекст, судження й підпис під наслідком дорожчі за виконання: юридичні, медичні, аудиторські, репутаційні. У лютому 2024-го трибунал Британської Колумбії визнав Air Canada відповідальною за знижку, яку вигадав її ж чат-бот, — компанію не врятував аргумент «за бота відповідає бот». Дослідники LLM в аудиті незалежно фіксують: моделі непогано систематизують документи, але для судженнєвих рішень лишаються «insufficiently robust». Gartner прогнозує закриття понад 40% агентних AI-проєктів до кінця 2027-го через неконтрольовані витрати; з тисяч вендорів, що називають себе «agentic», реальними Gartner визнає лише близько 130.

Коментарі

Лише для залогінених читачів — щоб лишалось людським, а не болотом ботів.