3 подписчика
Синтаксис разметки Markdown.
Я уже давно использую Obsidian, но только сейчас понял интересный факт. База знаний, созданная в этой программе, удобна не только для меня, но и для ИИ-агентов. Все дело в разметке Markdown. Его синтаксис максимально прост. Есть набор символов, которые однозначно описывают структуру документа.
Одна решетка обозначает заголовок первого уровня, а двойные звездочки - смысловое выделение. Шрифт, размер заголовка и отступы определяет программа, которая показывает документ. Текст при такой разметке удобно читать даже не отключая спецсимволы.
Как же хранит текст Microsoft Word? На самом деле если открыть файл формата .docx архиватором, то мы увидим внутри xml-документы, в одном из которых тот же самый фрагмент будет выглядеть следующим образом.
Microsoft Word вместе с текстом хранит привязки к стилям, перекрестным ссылкам и еще кучу вспомогательных данных. Любые изменения внешнего вида текста, будут описаны в этом файле. Чем менее системно оформлен документ, тем сложнее будет найти в нем смысл текста.
Языковая модель будет читать именно этот файл и ей придется пробираться через этот стилевой шум, чтобы найти текст. Конечно, это не означает, что нейросети не могут работать документами Microsoft Word. У них для этого есть специальные алгоритмы, но для языковой модели это потеря контекста и лишние затраты ресурсов.
Излишний контекст не нужен для базы знаний. Кажется самое время переводить свои архивы в файлы формата .md, если мы хотим, чтобы ИИ-агенты помогали нам писать документы.
#obsidian #word #chatgpt
1 минута
3 августа