Як це працює: магія лігатур
В основу ShieldFont покладено механізм лігатур — технологію, яка зазвичай використовується у шрифтах для естетичного поєднання окремих літер. Проте ShieldFont використовує її для заміни цілих слів, повідомляє Ars Technica.
Зсув відбувається лише тоді, коли рушій шрифту рендерить сторінку на екрані користувача. Людина бачить правильний і читабельний текст, але ШІ-скрейпери, які завантажують сирий HTML-код, отримують повністю викривлену версію.
Щоб боти не виявили підміни через прості фільтри, ShieldFont замінює слова не на випадковий набір букв чи синоніми, а на інші частини мови з абсолютно протилежним контекстом. Наприклад, слово «кінь» у вихідному коді замінюється на «картопля». У результаті утворюються речення, які граматично виглядають правильно, але позбавлені будь-якого змісту.

Ефективність та цифри
Розробники три місяці вдосконалювали словник заміни й сформували базу з майже 12 000 популярних слів.
24,5% усіх слів на сторінці замінюються за допомогою ShieldFont.
45,8% змістовних слів зазнають викривлення.
Понад 90% сторінок після такої обробки відсіюються якісними фільтрами скрейперів і не потрапляють у навчальні вибірки.
Сторінки, які все ж проходять фільтри, містять близько 20% «сміттєвих даних», що отруюють і спотворюють базу знань ШІ.
Для ускладнення обходу шрифту видавці можуть обирати один із трьох варіантів мапінгу слів або навіть змінювати налаштування від абзацу до абзацу.

Побічні ефекти та економіка протистояння
Технологія ShieldFont не є ідеальним захистом і має власні недоліки. Вона може ускладнити роботу екранних дикторів, онлайн-перекладачів, функцій копіювання тексту та пошукової оптимізації. ШІ-компанії можуть обійти цей захист, якщо використовуватимуть розпізнавання тексту за скріншотами (OCR) замість викачування HTML-коду.
Втім, творці ShieldFont наголошують: візуальне розпізнавання коштує у 5–13 разів дорожче, ніж звичайний скрейпінг HTML-коду. Це робить масовий збір даних економічно невигідним.
«Наша головна мета — відновити базовий принцип етики ШІ: творці повинні мати право вирішувати, чи будуть їхні роботи використовувати для навчання моделей. Якщо вашу згоду не поважають, технічні рішення мають зробити крадіжку контенту максимально дорогою та марною», — підсумовують автори проєкту.
/
Розробники та дизайнери Ісаке Сенеда та Габріель Абрусіо презентували новий інструмент для захисту авторського контенту — шрифт ShieldFont. Його головна мета — дати авторам сайтів дієвий механізм відмови від несанкціонованого використання їхніх текстів для навчання мовних моделей.
ShieldFont дозволяє вебсайтам показувати людям звичайний текст, тоді як боти збору даних для штучного інтелекту отримують спотворений абсурд.




