Anthropic прагне зробити AI-текст простішим для розпізнавання, і в теорії мені складно заперечувати. Компанія експериментує з invisible watermark, який можна вбудовувати безпосередньо в текст, згенерований Claude.
На перший погляд це виглядає як розумний підхід. **AI-згенерований текст** тепер всюди, і розуміння походження матеріалу справді може допомогти. До того ж Anthropic не просто ховає якийсь маркер усередині документа. Їхній метод змінює те, як Claude обирає слова, формуючи статистичний візерунок, який згодом можна виявити.
Але є нюанс, який мене не відпускає. Anthropic перевіряє, наскільки **стійким** може бути цей водяний знак навіть після того, як текст уже відредагували.
І саме тут я вже відчуваю, що можуть початися проблеми.

Claude торкнувся мого тексту: чи означає це авторство?
Подумайте про переклад. Уявімо, що людина повністю сама написала есе іспанською і просить Claude перекласти його англійською. **Ідеї — її**, **дослідження — її**, **аргументи — її**. Claude виконує лише роль перекладача.
Та попри це підсумковий англомовний текст все одно може нести водяний знак Claude.
Схожа дилема виникає й під час вичитки. А що, як людина написала все самостійно й попросила Claude виправити граматику? Або скоротити абзац, змінити тон, привести до ладу надиктований текст чи просто зробити незграбне речення читабельнішим?
Це вже давно не екзотика. Люди дедалі частіше використовують асистентів на кшталт ChatGPT, Gemini і Claude для щоденних завдань, які **не обов’язково** пов’язані зі створенням «оригіналу з нуля». Водяний знак здатен показати, що Claude був залучений до тексту. Але він не пояснює, чи **саме Claude** є автором. Anthropic говорить про це прямо: маркер фіксує участь Claude, а не те, хто створив первинний матеріал.
Тепер уявіть, як ви намагаєтесь донести цю різницю викладачу після того, як їхнє ПЗ уже позначило ваше есе як підозріле.

Ми вже бачили, наскільки хаотичним буває AI-виявлення
Я б хвилювався значно менше, якби our track record with AI detection був справді переконливим. Але це не так.
MIT Sloan’s guidance досить чітко описує стан сучасних AI-детекторів. Там зазначено, що вони мають high error rates і здатні підштовхувати викладачів до **помилкових звинувачень** у порушеннях.
І це не теорія — ми вже бачили наслідки. Students have found themselves defending work they say they wrote themselves після того, як автоматизовані системи визначали його як AI-згенероване. В одному випадку, описаному The Guardian, есе студента було позначене як повністю створене AI, хоча студент наполягав, що користувався лише дозволеною допомогою зі spelling і grammar. Зрештою апеляцію задовольнили.
Важливо уточнити: водяний знак Claude — це інша логіка. Звичайні AI detectors аналізують стиль і намагаються оцінити ймовірність того, що текст міг створити AI. Натомість Anthropic **свідомо вбудовує** сигнал у вихід Claude. Теоретично це має бути помітно надійнішим. Але проблема тут не лише в точності. Усе впирається в трактування результатів.

Ми залучаємо AI, щоб довести, що AI не було
Ситуація вже дійшла до відверто абсурдного рівня.
Студенти, які бояться AI-детекції, turning to so-called AI humanizers — сервісів, що переписують текст так, аби він рідше спрацьовував у детекторах. Дехто пропускає через них навіть власноруч написані роботи, бо переживає через **хибні спрацювання**. А компанії, що роблять детектори, у відповідь створюють методи виявлення humanizers.
Прочитайте це ще раз.
Людина може написати текст сама, злякатися, що AI вирішить, ніби це зробив AI, віддати написане іншому AI, щоб «олюднити» стиль, а потім чекати вердикту ще одного інструмента, який перевіряє, чи не був текст «олюднений» AI.
Це технологічний уроборос.
З технічної точки зору зробити водяний знак Claude таким, щоб він пережив редагування й переклад, — справді вражаюче. Попередні дослідження показували, що переклад може ламати деякі підходи до watermarking, тож усунення цієї слабкості було б **реальним прогресом**.
Просто мені не здається, що ускладнення видалення сигналу вирішує ключову проблему.

Водяний знак працює лише тоді, коли є контекст
Водяні знаки для AI-контенту можуть бути корисними. Вони здатні допомагати виявляти масові кампанії дезінформації, **непозначений синтетичний текст** або матеріали, написані AI й пізніше підмішані у тренувальні набори даних.
Та проблема в тому, що сучасні AI-асистенти роблять значно більше, ніж просто «пишуть з нуля». Їх використовують для перекладу, вичитки, узагальнення джерел, допомоги з кодом, покращення доступності або банально для того, щоб акуратно відредагувати лист перед відправленням. У такій реальності фіксація участі AI не дає автоматичної відповіді, **хто саме** створив зміст.
І ступінь участі AI у всіх цих сценаріях радикально різний. Якщо Claude повністю написав есе — це важлива інформація. Якщо Claude лише переклав есе, над яким людина три тижні працювала, сам факт участі Claude говорить набагато менше.
Водяний знак, можливо, бездоганно відповість на запитання «Чи торкався цього Claude?». Моя тривога — в тому, що багато хто почне сприймати цю відповідь як доказ «Чи написав це Claude?».
Anthropic може створити найрозумніший водяний знак у світі. Але якщо ті, хто його застосовує, не розумітимуть цієї різниці, я підозрюю, що попереду на нас чекають **серйозні конфлікти**.



