LLM делает одну вещь чрезвычайно хорошо: по заданному тексту предсказывает, какой текст должен идти дальше. После обучения на значительной части интернета эта единственная способность покрывает перевод, суммаризацию, ответы на вопросы, написание кода и ведение разговора.
Что у них получается хорошо
Черновики и переработка текстов, объяснение понятий, перевод между крупными языками, суммаризация длинных документов и помощь с рутинным письмом на работе или в учёбе. Для многих офисных задач это реальная экономия времени.
Чего остерегаться
LLM иногда галлюцинируют — бегло и уверенно утверждают ложное. Они отражают свои обучающие данные, в основном английские, китайские и русские: на малых языках качество резко падает. Никогда не вставляйте персональные или секретные данные в публичный чат-бот и всегда проверяйте факты, законы, даты, медицинские и финансовые утверждения по независимым источникам.
LLM и каракалпакский язык
Сегодняшние глобальные модели плохо справляются с каракалпакским: в интернете просто слишком мало каракалпакского текста, на котором они могли бы учиться. Это меняется по мере того, как в сеть выходит больше каракалпакского контента, — каждая опубликованная страница, включая четырёхъязычный контент этого сайта, становится будущими обучающими данными. Построить этот цифровой фундамент для языка — часть миссии AI-центра.