О принципах работы больших языковых моделей рассказал ведущий образовательного математического канала 3Blue1Brown Грант Сандерсон. Представьте, что вам попался короткий сценарий фильма, в котором описывается сцена между человеком и его помощником в виде искусственного интеллекта (ИИ). В сценарии есть то, что человек спрашивает у ИИ, но ответ ИИ не представлен. Предположим, у вас есть мощная магическая машина, которая может взять любой текст и выдать разумное предсказание того, какое слово в нем будет следующим. Тогда вы сможете дописать сценарий, передав машине тот текст, который у вас уже есть. Когда вы взаимодействуете с чат-ботом, именно это и происходит. Большая языковая модель – это сложная математическая функция, которая предсказывает, какое слово будет следующим в любом фрагменте текста. Однако вместо того, чтобы с уверенностью предсказать одно слово, она присваивает вероятность всем возможным следующим словам. Чтобы создать чат-бота, вы составляете текст, описывающий взаимодействие между пользователем и гипотетическим помощником ИИ, добавляете все, что пользователь вводит в качестве первой части взаимодействия, а затем заставляете модель несколько раз предсказать следующее слово, которое такой гипотетический помощник ИИ произнесет в ответ, и именно это слово будет представлено пользователю. При этом результат будет выглядеть гораздо естественнее, если позволить модели выбирать менее вероятные слова в случайном порядке. Более крупные модели с тех пор тренируются на гораздо, гораздо большем объеме. То, как ведет себя языковая модель, полностью определяется множеством различных непрерывных значений, обычно называемых параметрами или весами. Что делает большую языковую модель большой, так это то, что у нее могут быть сотни миллиардов таких параметров. Цель автозаполнения случайного отрывка текста из интернета сильно отличается от цели стать хорошим помощником ИИ. Кстати, до 2017 года большинство языковых моделей обрабатывали текст по одному слову за раз, но затем команда исследователей из Google представила новую модель, известную как трансформер. Самым первым шагом трансформера, да и большинства других языковых моделей, является ассоциация каждого слова с длинным списком чисел.Financial One