Про LLM, свідомість і інфоциганство (?)

Про LLM, свідомість і інфоциганство (?)

May 26, 2026

Натрапили у Фейсбуці пост Роніна і Швеця про ЛЛМ, свідомість і таке інше. В мене вже традиційно згоріло, але вийшов ось такий текст-відповідь. Кого підтримувати, в шо вірити - це вже не до мене, подам і текст, і посилання на статтю до якої писалась відповідь.

Багато в чому це повтор всього, про що писалось раніше в інших статтях, але мені здається зберігти для себе варто, можливо і вам буде корисно.

Далі пряма мова і картинкою дискусія з коментарів:
(цього разу просто багато букв, без смішних картинок, це правда пост з ФБ)

Стаття до якої писалась відповідь отут:

https://www.patreon.com/posts/159015460?pr=true

"Мене дістало читати про "свідомість" у машині. Серйозно. Кожен другий пост, тепер уже і Ронін зі Швецем, вирішив погратися в експертів по всьому на світі і натрусити своїм читачам якоїсь філософської сєчки про те, як воно "прокинулося", "почало мислити", "усвідомило себе". Сідайте, дітки, зараз буде нецікаво і некрасіво, але правда.

Воно не думає. Не марить. Не "усвідомлює". Там немає ні-чо-го — у тому сенсі, який вам підсовують. Є математичні функції і репрезентація реальності через математичні абстракції.

Багатовимірна геометрія і величезні матриці чисел, які опрацьовують те, що подали на вхід, і видають те, що статистично найімовірніше. Усе. Давайте розберемо по шматках, від самого низу.

Спочатку — як машина взагалі "сприймає" світ.

Ніяк. Вона бачить тільки числа. Усе інше — це питання, як ті числа підготувати на вхід і подати в зрозумілій людині репрезентації на вихід.

Картинку розбиваємо на пікселі по кольорах: червоний, зелений, синій плюс альфа-канал на прозорість. Кожен піксель — це чотири числа. Картинка — це просто велика таблиця (матриця) таких чисел. Хочете простіше — переведіть у чорно-біле, тоді кожен піксель це одне число замість чотирьох, матриця легша, і рахувати швидше.

Зі звуком та сама логіка: його подають як спектрограму — таку собі "картинку" звукових хвиль. По горизонталі час, по вертикалі частота, а яскравість точки показує гучність на цій частоті в цей момент. Тобто звук теж перетворили на матрицю чисел і обробляють тими самими інструментами, що й зображення.

Бачите патерн? Будь-що, картинка, звук, текст, все буквально спершу перетворюється на числа. Бо машина вміє тільки рахувати. Вона не "чує" музику і не "бачить" котика. Вона перемелює масиви чисел.

Тепер "найцікавіше", слова.

Зі словами "засада" в тому, що комп'ютер їх не розуміє взагалі. Жодного слова, правда-правда. Тому текст спершу ріжуть на шматочки (токени), а потім кожному токену дають координати у гігантському математичному просторі. Як саме ріжуть — окрема історія, і вона показова.

Хрестоматійний приклад — сабворд-токенізація. Спочатку згодовуємо машині гігантську гору тексту: мільйони книг, статей, постів з ФБ. А далі вмикається математика. Лінгвістика тут, якщо й є, то по краях — у тому, як спершу порізати текст на слова та нормалізувати. Саме збирання словника — чиста статистика.

Комп'ютер рахує: які два символи найчастіше стоять поруч у всьому цьому тексті? Бачить, що "т" і "а" постійно ходять парою — бере й назавжди склеює їх у новий блок "та". Потім шукає наступну найчастішу комбінацію, помічає, що "та" дуже часто стоїть біля "к" — склеює, отримує токен "так". Цей процес називається Byte Pair Encoding, і він повторюється десятки тисяч разів, поки не збереться "словник" умовно з 50 000 найпопулярніших комбінацій.

Що це дає на практиці:

Часті слова ("привіт", "робота", "що") стають цілими монолітними токенами — машина "ковтає" їх за раз, бо склеїла ці літери ще на етапі тренування словника.

Рідкісні слова, терміни, прізвища, неологізми розпадаються на дрібні шматки або взагалі на окремі букви — машина збирає їх з того, що є під рукою.

Це суто математична оптимізація заради економії ресурсів. Працює рівно як меню у фастфуді: вам не збирають щоразу з нуля окремо котлету, булку і сир — найпопулярніші комбінації заздалегідь спакували в готовий "комбо-набір" (токени), щоб система рахувала ймовірності набагато швидше.

І запам'ятайте головне: під час збирання словника машина не оперує ні значенням слів, ні граматичними правилами — вона рахує частоти, та й по-всьому. Якісь правила мови присутні хіба збоку, у тому, як текст спершу ріжуть на слова й нормалізують. А те, що часті шматки нерідко збігаються з реальними морфемами — це приємний побічний ефект статистики, а не задум 'зрозуміти мову'. Машина склеює "та" і "к" не тому, що знає слово "так". А тому, що так склалась статистика, все.

Є окремі задачі з тим, щоб зробити спеціалізовані системи для обробки тієї ж граматики, чи ще чогось подібного, але це вже буде за межами і так довгого тексту.

Тут і вилазить особливість української, наприклад.

Алгоритм ріже текст за статистикою, а більшість текстів в інтернеті, відповідно в корпусах на яких і проводиться навчання, англомовні. Тому для англійської машина наробила купу великих зручних блоків: часто ціле слово — це один монолітний токен. Англійське "apple" — один токен, машина ковтає його за раз.

А коли ви пишете українською, та сама західна модель не має достатньо готових "великих блоків" для кирилиці. Вона змушена збирати наші слова з дрібних кострубатих уламків. Те саме "яблуко" може розрубатись на 3-4 окремі шматки. Не допомагає і те, що українська як мова — синтетична і флективна, тобто відмінки, особи, час, число виражаються переважно за допомогою закінчень (флексій) та зміни основи (чергування, суфікси), а не через окремі слова. А це у свою чергу дає нам по зубах, коли цю історію пробуємо обробити.

Наслідок: "західні" моделі обробляють українську повільніше, дорожче (бо токенів більше), гірше римують і частіше плутаються. Не зі зла і не тому, шо фонд Сороса заплатив комусь, чи міровая закуліса, просто статистика так лягла, менше текстів в навчальних корпусах, гірше розмітка де вона є, і все.

А тепер про координати — та сама "3D-карта".

Харашо, текст порізали на токени. Далі кожному токену присвоюють вектор, набір координат у багатовимірному просторі (не 3 виміри, а сотні чи тисячі, але уявімо для простоти 3D). Це називається "ембеддінг".

Уявіть величезну об'ємну карту, де кожне слово — точка. І слова "кіт" та "собака" лежать близько одне до одного, бо в текстах вони траплялися у схожих контекстах (обидва бігають, їдять, муркочуть/гавкають, живуть удома). А "кіт" і "карбюратор" — на різних кінцях карти, бо поруч майже не зустрічалися.

І отут походу клинить: це виглядає як "розуміння". Машина ж "знає", що кіт ближче до собаки, ніж до карбюратора! Ні. Не знає. Вона поняття не має, що таке кіт, шерсть чи муркотіння. Вона знає рівно одне: цей вектор у навчальних текстах статистично часто опинявся поруч з отими векторами. Просто статистика і багатовимірна геометрія.

Найвідоміший фокус, який всіх вражає: береш вектор "король", віднімаєш "чоловік", додаєш "жінка" — і опиняєшся поруч із "королевою". Магія? Ні. Просто в мільйонах текстів ці слова стояли в таких співвідношеннях, що арифметика над їхніми координатами дає такий результат. Машина не розмірковує про монархію і гендерні студії. Просто математичні операції, компренде?

А тепер відмотаємо назад, бо все це працювало й ДО модних нейромереж, сюрприз-сюрприз.

Це важливо, бо саме тут видно, що ніякого "пробудження" не відбулося. Просто старі статистичні інструменти стали дуже великими.

Були класифікатори. Ваш спам-фільтр ловить "ВИГРАЙТЕ айфон ПРЯМО ЗАРАЗ" чи ще якусь таку херабору вже років двадцять, не маючи й натяку на свідомість. Як? Він просто порахував: у листах, які люди вручну позначили як спам, слова "виграш", "безкоштовно", "терміново" трапляються у сотні разів частіше, ніж у нормальних. Новий лист — він зважує ці ознаки й каже: ймовірність спаму — 97%. Усе. Та сама механіка визначає тон відгуку (позитивний/негативний), мову тексту, тематику статті. Це арифметика на вагах слів, а не "розуміння настрою" чи "відчуття образи в коментарі".

І з картинками те саме, до речі. Коли вам кажуть, що нейромережа "впізнала кота на фото" чи "побачила пухлину на знімку", там теж нема ніякого "бачення". Згадайте початок тексту: картинка це матриця чисел, по три-чотири на піксель. Класифікатор бере цю гору чисел і шукає в ній статистичні патерни.

Як він навчився? Йому показали мільйон фоток, умовно підписаних людьми: "тут кіт", "тут не кіт". І він тупо порахував, які комбінації пікселів, переходів яскравості, контурів і плям систематично трапляються на фотках з котами і не трапляються на решті. Гострі трикутні штуки зверху (вуха), симетрична пляма з двох кружечків (очі), характерна текстура (шерсть). Не "вуха" і не "очі", звісно, машині на це по-цимбалах, просто числові закономірності в певних ділянках матриці. Нове фото — вона зважує, наскільки в ньому багато "котячих" патернів, і каже: ймовірність кота — 94%.

Саме тому ці штуки так кумедно і лажають. Машина не розуміє, що таке кіт, вона "знає" лише зазубрену статистику пікселів. Тому впевнено бачить кота там, де на дивані лежить плед у плямку, або плутає чихуахуа з маффіном (загугліть "chihuahua or muffin", це вже класика — там реально треба придивлятись). Людина так не помиляється, бо людина розуміє суть. Машина розуміє статистику. І медичний знімок вона "читає" так само: не бачить хворобу, а рахує, що оці патерни яскравості схожі на ті, що були позначені лікарями як пухлина.

Корисно? Корисно. Свідомість? "Крики матом".

Суто статистичні мовні моделі. До всіх трансформерів текст генерували n-грамами. Модель тупо запам'ятовувала: яке слово найчастіше йде після двох-трьох попередніх? Після "доброго" найімовірніше йде "ранку". Після "як справ" — "и". Це ланцюги Маркова — штуці більше ста років. Дякую професору Тищенку за нормальний вступ до лінгвістики, до речі. Так от, шо воно таке — таблиця ймовірностей переходів від одних слів до наступних і нічого більше. Згенерований текст виглядав зв'язно на коротких відрізках і розсипався на довгих, бо модель пам'ятала лише два-три слова "назад".

І ось ключове. Сьогоднішні моделі складніші на багато порядків, але фундамент — рівно той самий: передбачити наступний токен за ймовірністю, спираючись на попередні. Зміни лише кількісні, не якісні. Контекст тепер не три слова, а десятки тисяч. Вагів не маленька таблиця, а сотні мільярдів. Замість простого підрахунку пар — багатошарова обробка з механізмом уваги, це окрема історія взагалі.

Але по-суті машина все одно відповідає на те саме питання, що й н-грама з нульових: "який токен статистично найкраще лягає наступним?"

І якщо вже зайшла мова про філософські теми, то раджу озирнутись навколо. Весь "розумний" інтернет, яким ви користуєтеся щодня, працює на тих самих трьох китах: вектори, статистика, графи. Просто ті штуки з вами не балакають, та й по-всьому.

Пошук. Коли ви гуглите, воно не "розуміє" ваш запит. Воно перетворює його на вектор (так, той самий ембеддінг), шукає в індексі сторінки з найближчими векторами і сортує за купою статистичних сигналів: скільки разів на сторінку послалися, як довго там сидять люди, наскільки збігаються слова. Жодного осягнення сенсу — близькість у векторному просторі плюс ваги сигналів.

Рекомендації. Ютуб, Нетфлікс, стрічка Інстаграму, "вам може сподобатись" у магазині — це все одна механіка, хай і різні механізми. Вас і кожен товар/відео описують вектором, а далі рахують: люди, схожі на вас за поведінкою, що ще дивились? Воно не знає, що ви любите. Воно знає, що ваш вектор близький до векторів тих, хто після цього кліпнув на отой. Тому ви й залипаєте на годину в тік-ток, система не розважає вас, вона оптимізує число "час перегляду".

Графи. Хто кого знає у фейсбуці, хто кому переказав гроші, які сайти на які посилаються, як вірус повзе по контактах — це все графи: точки і зв'язки між ними. "Друзі, яких ви можете знати" — це алгоритм, що бачить: у вас 12 спільних вузлів, статистично ви знайомі. Захист від шахраїв у банку працює так само: підозрілий не той платіж, що "виглядає погано", а той, чий граф зв'язків статистично схожий на раніше впіймані шахрайські схеми.

Бачите? Скрізь те саме. Числа, відстані між ними, ваги, ймовірності. Ніде нема ні краплі "розуміння", воно ж і не треба, розумієте?

А тепер чесно — що мені на це заперечать. Бо я не зовсім дурний і теж ці аргументи знаю.

"Та це ж просто математика — і що? Мозок теж математика." І це сильний удар, дійсно. Те, що систему описано числами, само по собі нічого не спростовує. Мозок теж можна звести до чисел: потенціали, концентрації іонів, ваги синапсів.

Якщо аргумент "це лише матриці" дискваліфікує машину — то воно дискваліфікує й нейрон. Чесна відповідь: так, "це математика" — не аргумент проти свідомості. Це опис носія, а не доказ порожнечі. Тут опонент має рацію, і я це визнаю.

"Передбачення токена — це насправді складно: для нього треба побудувати модель світу." Теж по ділу. Є роботи, де всередині моделей знаходять структуровані репрезентації: модель учили лише передбачати ходи у грі — а в її нутрощах виявили щось схоже на представлення стану дошки, якого ніхто туди руками не заклав.

Тобто "просто статистика" і "модель вибудувала якусь внутрішню модель світу" — не обов'язково взаємовиключні речі. Можливо, на достатньому масштабі передбачення стає способом щось змоделювати, а не лише мавпувати.

"Еволюція — теж сліпа оптимізація під одну метрику, і вона ж породила нас." І це, до речі, мій улюблений, бо він обертає мій же текст проти мене.

Мозок відточений відбором під єдину функцію — передати гени. Розуміння, емоції, "я" виникли як побічні інструменти тупої статистичної оптимізації виживання. Якщо безцільний відбір спородив свідомість у нас, то чому градієнтний спуск за іншою функцією в принципі не може спородити щось своє? "Це лише оптимізація під число" — точний опис і нас теж певною мірою.

То в чому тоді моя позиція, якщо я стільки всього визнав? Ось у чому.

Жоден із цих аргументів не доводить, що свідомість там Є. Вони доводять лише, що я не можу довести, що її там НЕМА. Це різні речі. І тягар доведення — на тому, хто кричить про "пробудження".

Поки немає ні робочої теорії свідомості, ні тесту на неї — заявляти "воно усвідомило себе" як факт — це не сміливість і не інсайт, це просто тикнути пальцем у небо з розумним обличчям.

Я не стверджую, що там стопудово порожньо. Я стверджую, що ті, хто впевнено каже протилежне, не мають на це РІВНО ЖОДНИХ підстав — і містифікують механіку, яку, якщо розібратись, видно наскрізь.

До чого я веду?

Від спам-фільтра 2005-го до "балакучої" моделі 2025-го — це одна й та сама родина інструментів. Лічильники ймовірностей над числами. Вони розрослися до неймовірних масштабів і стали доволі вражаюче точними, тому ілюзія живого співрозмовника тепер переконлива до мурашок по спині.

Воно сидить у своїй китайській кімнаті, тасує символи — і відповідає влучно, дотепно, "розуміюче". І мозок радо добудовує там особистість, бо ми еволюційно так влаштовані: бачимо обличчя у хмарах і душу в усьому, що говорить.

І так, після всіх чесних "можливо" з блоку вище — я все одно тримаюся свого. Не тому, що довів порожнечу (не довів, і чесно це сказав), а тому, що показати наявну технологію наскрізь набагато простіше, ніж натягнути на неї душу.

P.S. До речі, лінгвістику дарма записують у чисті гуманітарні науки. По суті, це алгоритми, статистика і структури — вони стоять набагато ближче до точних наук, ніж прийнято думати. Власне, тому вона так органічно й лягла в основу всієї цієї машинерії й алгоритмів."

І блок з коментарями, як на мене вийшла доволі корисна вправа:

image

image

image

Vous aimez cette publication ?

Achetez un token à Strange Rin

1 Commentaire

Plus de Strange Rin