- BrainTools - https://www.braintools.ru -

О новом мире, деглобализации, иммиграции и будущем llm

О новом мире, деглобализации, иммиграции и будущем llm - 1

Если вся вторая половина века XX-го и начало XXI-го веков проходили под знаком глобализации, то теперь, если верить Хантингтону ( я имею ввиду его работу “Столкновение цивилизаций”), нас ждет многополярный мир, разделенный на несколько цивилизаций. Несмотря на то, что книга написана в далеком уже 1996 году, события последних лет говорят о том, что она не только не устарела, но стала еще более актуальной.

Кроме того, внутри одних общностей иммиграция стала создавать значительные локальности иных по отношению к принимающей, неохотно смешиваемых, культур.

Еще один фактор – это обосабливание некогда общих культур. Если основной тенденцией эпохи однополярного мира после холодной войны и нацеленности на создание единой глобальной экономики и повсеместной вестернизации, было стирание границ, то сегодня нас ждет обратный процесс. Более того, по мысли Хантингтона он не прекращался и в более или менее скрытом виде наблюдается уже с 80-90-х годов прошлого века.

Если с первыми двумя факторами более-менее все понятно, по крайней мере в отношении их культурного и лингвистического анализа, то с последним не все так просто. Так, в случае “простого” смешения и/или пересечении семантических полей изначально обособленных общностей, наше понимание упрощается несколькими факторами.

Во-первых, семантическое ядро изначально изолированных культур имеет четкие границы, что значительно упрощает применение, например, таких инструментов как TF-IDF и BM25.

Во-вторых, эти культуры существуют достаточно давно и на протяжении истории возникло довольно большое количество исследований.

В-третьих, принципиальные языковые различия позволяют легко отделить одни корпуса текстов от других.

Конечно, здесь существуют как минимум две проблемы о которых писал, в частности, Умберто Эко.

Во-первых, это проблема невозможности точного перевода с одного языка на другой, суть которой в том что невозможно “просто” сопоставить два корпуса текстов из-за разницы культурного и исторического опыта [1]. За пределами простых случаев, перевод связан с невозможностью точного сопоставления ментальных образов двух текстов. В качестве простого примера мы можем привести проблему цветового и органолептического описания. Далеко ходить не надо. Это, например, и пресловутая проблема синего и зеленого цветов и разные ассоциации [2], связанные с запахами [3]. Это и различия в ассоциативных полях, сформированных культурно-исторически. Например, речь идет о метафорах, типовых описаниях добра и зла и многое-многое другое.

Во-вторых, проблема построения онтологий. А именно, проблема зависимости смысла от контекста и невозможности построить универсальных тезаурусов. Умберто Эко пишет о том, что смыслы складываются скорее в сети, нежели в деревья.

Гораздо более сложная картина получается в случае распада некоторых общностей, усугубляемая их дрейфом к другим культурам. В качестве примеров приведу четыре случая:

Первый пример – это проблема распада Британской империи, когда в результате мы видим много обособленных регионов, которые вроде бы используют один язык – английский, но смыслы вкладываемые в слова и идиомы начинают сильно различаться. Это касается наблюдаемой картины с австралийским, индийским (по сути) диалектами английского языка.

Второй относится к особенностям инженерной терминологии в Северном и Южном корейском языке. Северокорейские термины основываются на китайской инженерной культуре. В то время как Южнокорейские-на японской.

Третий относится к обнаруженным мной особенностям, например, при анализе и парсинге ФИО. Если раньше, при СССР, существовали более-менее единые нормы для всех паспортных и иных аналогичных учреждений, то теперь даже написанные кариллицей, они начинают выглядеть совершенно по разному. Например, если раньше двойные фамилии писались преимущественно через дефис, то теперь часто в документах можно видеть просто кортеж слов. Если раньше суффиксы типа “оглы”, “кызы” писались через дефис, то теперь – нет. Более того, встречается в документах приписка с национальными обращениями типа “ханум”. Сегодня мы видим, по сути, отсутствие фамилий в документах бывших советских республик. Да, были и раньше сложности с арабскими кортежами типа “сын того-то сын-того то” и (так до бесконечности), но это касалось иностранных (в тех условиях) граждан. А все документы СНГ имели поле с фамилией. Или сильная контекстная зависимость понимания значения слов “Ван”, “Бен” и т.д.

Четвертое: сегодня относительная линейность при транслитерации перестает работать. Это касается как “простых” случаев, таких как склонность китайцев не транслитерировать свои имена, а придумывать новые (латинизированные для внешних каналов коммуникации) имена. Или существующие факты о необходимости знать особенности транслитерации внутри одних алфавитов даже при условии общей языковой базы. Речь идет, например, о невозможности “простой” транслитерации при формировании каталогов SKU, ЗИП. Например, в случае создания систем учета запасных частей и инструментов при поставках сложной техники на экспорт.

И это только вершина айсберга. В целом, старые проблемы типа коротких длин полей как когда-то в Siebel или разнесения поля с адресом по типу address_line_1, address_line_2 теперь покажутся мелкими неприятностями.

Такие изменения, как мне кажется, приводят к необходимости пересмотра подхода к подготовке обучающих выборок и самой стратегии применения тех или иных уже обученных моделей. Все это приводит к необходимости создания новых, по сути, инструментов, обеспечивающих:

  1. Дополнительно, к существующим разметкам (языковым, отраслевым, стилистическим) необходимо добавить еще и культурологическую. Т.е. мы не просто должны разметить корпуса подаваемых для обучения [4] текстов , но и добавить еще один параметр – признак культурного кода.

  2. При формировании запросов необходимо учитывать в пространстве какого культурного кода сформирована та выборка, на которой обучалась экзаменуемая нами модель.

  3. При проектировании диалоговых систем (например, чат-ботов ) необходимо вводить блок предварительного анализа того, какую культурную общность представляет пользователь. Причем, простого вопрошания типа: “чей ты будешь?” недостаточно. Необходима, в частности, новая стратегия, позволяющая предсказать все эти особенности.

Т.е. требуется применение более расширенного инструментария, где “простого” дополнения RAG или применения разного рода ассистентов становится недостаточно.

В практическом плане, такого рода тенденции на новую регионализацию мира ставит новые задачи перед системами так или иначе связанными с обеспечением качества данных, автоматическим распознаванием документов (договоров, резюме т.д.), ведением разного реестров и управления данными (будь-то CDI, MDM, ERP и т.д. решения), маппингом одних сущностей на другие, поиском аналогов и дедубликации.

Таким образом, оказавшись на пути деглобализации, мы сегодня стоим на пороге нового этапа, требующего аудит и пересмотр существующих стратегий при работе с данными и LLM, в частности.

Автор: MaximKovalev

Источник [5]


Сайт-источник BrainTools: https://www.braintools.ru

Путь до страницы источника: https://www.braintools.ru/article/34726

URLs in this post:

[1] опыта: http://www.braintools.ru/article/6952

[2] ассоциации: http://www.braintools.ru/article/621

[3] запахами: http://www.braintools.ru/article/9870

[4] обучения: http://www.braintools.ru/article/5125

[5] Источник: https://habr.com/ru/articles/1073112/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1073112

www.BrainTools.ru

Rambler's Top100