Semantic knowledge engine for Obsidian with auto-classification and DAG hierarchy
io.github.KVANTRA-dev/NOUZ-MCP (MCP)
NOUZ is a semantic knowledge engine for Obsidian that performs auto-classification and builds a DAG (directed acyclic graph) hierarchy. It operates with Obsidian, Logseq, and any directories of Markdown files, using the MCP Python SDK v2.
🛠️ Key Features
Semantic knowledge engine
Auto-classification
DAG hierarchy derived from content
Works with Obsidian, Logseq, and Markdown directories
Built on MCP Python SDK v2
🚀 Use Cases
Organize knowledge bases in Obsidian or Logseq
Generate a structured hierarchy from Markdown content
Enable semantic search workflows over local notes
⚡ Developer Benefits
Targets local-first Markdown directories
Uses MCP Python SDK v2
Includes MIT-licensed project artifacts and Python 3.10+ support
⚠️ Limitations
Source material does not specify supported MCP tools/endpoints or runtime behavior beyond classification/hierarchy and Markdown/Obsidian/Logseq compatibility.
NOUZ выступает прослойкой между вашей базой заметок и AI-агентом. Он помогает превратить разрозненные Markdown-файлы в граф, с которым удобно работать и вам, и агенту:
Автоматическая классификация (Семантика)
Вы задаете "Ядра" — базовые домены вашей базы. Когда вы добавляете новую заметку, NOUZ читает ее текст, сравнивает векторы и предлагает доменный знак или комбинацию доменов.
Поиск связей между заметками
Сервер строит направленный структурный граф: hierarchy держится как DAG без циклов, а дополнительные смысловые связи живут рядом:
Семантические мосты: две заметки из разных доменов указывают на одну и ту же идею.
Явные теговые связи можно хранить вручную в YAML.
Отслеживание эволюции базы (Дрифт)
NOUZ хранит доменный профиль содержательных узлов и может сравнить его с заявленным знаком. Если модуль описан как один домен, а его профиль постепенно тянет в другой, сервер покажет расхождение (core_drift).
В зависимости от ваших задач NOUZ работает в трех режимах: от простого графа (LUCA) до строгой 5-уровневой иерархии (SLOI).
Как это работает
Вы описываете домены в config.yaml — какую область покрывает каждый домен и по каким признакам текста его узнавать.
Сервер превращает описания в векторы-эталоны (локально, через LM Studio или Ollama).
Каждая новая заметка проецируется на эти оси. Знак определяется содержанием, или вами.
Здесь важно разделять два слоя. artifact_signs описывают форму L5-артефактов: лог, источник, гипотеза, спецификация и так далее. Эти знаки не агрегируются в доменный знак L4. Лог остается логом, источник остается источником.
core_mix — не сумма типов артефактов. Это доменный профиль в SQLite-индексе. L4/L3/L2 получают его из собственного текста при recalc_signs, а родительские узлы могут затем получить усредненный профиль дочерних содержательных узлов через recalc_core_mix. core_drift появляется, когда сохраненный доменный профиль и текущий sign указывают на разные ведущие домены.
Семантические мосты находят связи между заметками из разных доменов, когда тексты близки по смыслу. Если для обеих заметок уже есть чанки, мост дополнительно проверяется лучшей парой из них и возвращает конкретный признак. Теги остаются явной пользовательской разметкой.
Пересчитать доменный профиль родителей по дочерним содержательным узлам
index_all
Переиндексировать всю базу; в PRIZMA/SLOI с with_embeddings=true также обновляет эмбеддинги файлов/чанков
embed
Получить вектор для текста в PRIZMA/SLOI
chunk_text
Разрезать Markdown-текст на стабильные чанки в PRIZMA/SLOI
chunk_file
Разрезать тело одной заметки на стабильные чанки в PRIZMA/SLOI
search_chunks
Искать по сохранённым chunk embeddings в PRIZMA/SLOI; по умолчанию снижает анизотропию
list_files
Список с фильтрами по уровню, знаку
get_children
Пройти вниз по графу
get_parents
Пройти вверх по графу
suggest_parents
Найти родителей для сироты
add_entity
Создать сущность в один шаг (автоматический знак и иерархия, теги только явно)
process_orphans
Автозаполнение файлов без разметки
Конфигурация
Минимальный config.yaml:
yaml
mode:prizmaetalons:-sign:Sname:SystemsAnalysistext:>
Methodology for analysing complex objects: feedback loops,
emergent properties, self-regulation, bifurcation points.
Cybernetics, synergetics, dissipative structures, catastrophe
theory, autopoiesis — tools for understanding how the whole
exceeds the sum of its parts. Not data and not code — a way
of thinking about how parts form a whole and why systems
behave non-linearly.
-sign:Dname:Data&Sciencetext:>
Physics and cosmology: from subatomic particles to the large-scale
structure of the Universe. Lagrangians, curvature tensors, scattering
cross-sections, quarks, bosons, fermions, plasma, vacuum fluctuations,
cosmic microwave background, cosmological constant, decoherence.
Pure science about the nature of matter, energy and spacetime.
-sign:Ename:Engineeringtext:>
Software engineering, machine learning and infrastructure: writing
and debugging code, deployment, containerisation, neural networks,
inference, tokenisation, data serialisation, microservices, CI/CD,
automated testing, refactoring, Git, Docker, Kubernetes, APIs.
The practical discipline of building computational systems from
architecture to production.
thresholds:sign_spread:0.05confident_spread:60.0pattern_second_sign_threshold:30.0semantic_bridge_threshold:0.55parent_link_threshold:0.55artifact_signs:-sign:nname:Notetext:Shortnote,observation,fragment.-sign:cname:Concepttext:Definition,concept,entitydescription.-sign:rname:Referencetext:Externalsource,documentation,link,citation.-sign:lname:Logtext:Sessionlog,chronology,dialoguerecord.-sign:uname:Updatetext:Update,releasenote,changelogentry.-sign:hname:Hypothesistext:Hypothesis,assumption,speculativeidea.-sign:sname:Specificationtext:Technicalspecification,instruction,requirements.
После настройки запустите calibrate_cores — сервер создаст эталонные векторы.
Проверьте попарные косинусы: mean-centered между разными доменами должен быть
заметно ниже исходного. Если все пары примерно одинаковые — усильте различия в текстах.
Отдельную проверку эталонов можно запустить из установленного пакета:
nouz-calc-etalons --config config.yaml.
etalons — это смысловые домены, которые сравниваются через эмбеддинги.
artifact_signs — тип материала для артефактов L5: заметка, концепт, ссылка, лог, обновление, гипотеза или спецификация. Это эвристическая метка. Домены обычно обозначаются заглавными буквами (S/D/E), а типы материала — строчными (n/c/r/l/u/h/s); их можно заменить в конфиге на любые другие значения. При необходимости для любого типа можно добавить keywords: тогда сервер будет использовать ваши слова для эвристики вместо встроенного RU/EN набора.
Реальный пример расчёта
Вот фактические результаты для эталонов S/D/E с моделью text-embedding-granite-embedding-278m-multilingual:
Отрицательные mean-centered значения здесь хороший результат: после вычитания среднего вектора домены хорошо расходятся. Smoke test эталонов текущим nouz-calc-etalons: S→99.6%, D→98.5%, E→98.1%. Это не оценка всей базы, а быстрая проверка, что каждый эталон после того же центрирования уверенно возвращается к своему знаку.
Переменная
По умолчанию
Описание
OBSIDIAN_ROOT
./obsidian
Путь к хранилищу
NOUZ_CONFIG
(пусто)
Абсолютный путь к config.yaml; если не задан, сервер ищет конфиг в текущей директории
NOUZ_DATABASE_NAME
obsidian_kb.db
Имя файла SQLite-кэша внутри OBSIDIAN_ROOT; удобно для изолированных проверок, например obsidian_kb.public.db
NOUZ_DATABASE_PATH
(пусто)
Полный путь к SQLite-кэшу; имеет приоритет над NOUZ_DATABASE_NAME