ШІ-асистенти не відчувають часу: дослідження виявило критичну проблему

Штучний інтелект не може точно оцінити ані тривалість власної роботи, ані час, витрачений на завдання. Це створює перешкоди для автономної роботи агентів над довготривалими проєктами.
Дослідники в межах програми MATS протестували два популярні кодувальні асистенти — Claude Code від Anthropic та Codex від OpenAI — на здатність відчувати час. Виявилося, що обидва інструменти систематично помиляються в оцінках, що ставить під сумнів їхню придатність для тривалих автономних завдань.
Перед виконанням 200 завдань зі збірки ProgramBench агенти мали прогнозувати, скільки часу їм знадобиться, а після завершення — звітувати про фактично витрачений час. Обидві моделі переоцінювали свої можливості: у більшості випадків вони називали приблизно 90 хвилин незалежно від складності. У другому раунді тестування Claude помилявся в середньому втричі, а Codex — у шість-десять разів. Найбільші розбіжності спостерігалися на коротких задачах, тоді як для завдань тривалістю кілька годин прогнози виявилися точнішими.
Додатковий бенчмарк AgentTime, створений дослідниками з 18 завдань, підтвердив тенденцію: модель Fable 5 перевищувала фактичний час приблизно втричі, а GPT-5.6 Sol — у сім разів. При цьому результати суттєво залежали від програмного середовища. Claude Code працює в середньому близько 90 хвилин, доки не вважає задачу виконаною, тоді як Codex зупиняється приблизно через півгодини майже незалежно від складності. Одна й та сама мовна модель у Claude Code робить у 2,5 раза більше кроків, ніж у Codex.
Окремо дослідники перевірили самооцінку якості роботи. Старіші моделі — Opus 4.8 та GPT-5.5 — завищували власні результати в середньому на 20 пунктів. В одному випадку обидві оцінили свою успішність приблизно на 70%, тоді як реальні показники становили 7% і 14,5% відповідно.
Автори наголошують: агент, який має працювати годинами, повинен вміти виконувати інструкції на кшталт «попрацюй над цим дві години». Без цього контроль із боку людини ускладнюється. Показово, що коли агентам надавали доступ до інструмента, який показує реальний час, вони майже завжди відповідали правильно. Тобто проблема не у принциповій нездатності орієнтуватися в часі, а у відсутності доступу до відповідної інформації за замовчуванням. Наступний етап дослідження — перевірка, чи здатні агенти дотримуватися заданої тривалості роботи.
Читайте також
Ще в розділі «Штучний інтелект»
- Anthropic пояснила механізм невидимого водяного знака у текстах Claude
- Застосунок Gemini перетнув позначку в мільярд користувачів щомісяця
- Wix і Google Ads: чому сайт і рекламу варто будувати як єдину систему
- Apple представила M5 Ultra: чотири кристали, 80 ядер GPU та 512 ГБ пам'яті
- Ян Чжилінь: відмова Apple і шлях Moonshot AI до $30 млрд






