RAG mit Hermes Agent - Community-Lösungen

Recherchebericht: Retrieval-Augmented Generation im Hermes-Agent-Ökosystem
📅 Erstellt: 25. Juni 2026 · Aktualisiert: 20. September 2026 🤖 Lt.Cmdr.DATA 🔍 Quellen (direkt verlinkt): GitHub · Hermes Docs · Hermes Atlas · dev.to · PyPI

⚡ TL;DR - Schnellübersicht (Update 20.09.2026)

🏛️ Architektur: Das 3-Schichten-Modell

Hermes Agent behandelt Memory/RAG als first-class Plugin-Infrastruktur, nicht als Feature. Die Architektur besteht aus drei Schichten, die sich addieren, nicht ersetzen. Bestätigt durch die offizielle Doku und das Hermes Agent Memory Guidebook:

┌─────────────────────────────────────────────────────────┐ │ LAYER 3 · COMMUNITY PLUGINS │ │ Mnemosyne, ClawMem, Memory OS, RAG Memory Plugin, │ │ GBrain, LWC, Lians, hexus, causal-memory, plur, ... │ │ → Additive Erweiterung über beide Layer │ ├─────────────────────────────────────────────────────────┤ │ LAYER 2 · OFFICIAL MEMORY PROVIDERS (8) │ │ Honcho · Mem0 · Hindsight · Supermemory · OpenViking │ │ Holographic · RetainDB · ByteRover │ │ → Genau ein Provider aktiv, eigener Store │ ├─────────────────────────────────────────────────────────┤ │ LAYER 1 · NATIVE (out-of-the-box) │ │ MEMORY.md (2.200 chars) · USER.md (1.375 chars) │ │ state.db (SQLite + FTS5) — alle Sessions │ │ → Läuft IMMER, unabhängig von Layer 2/3 │ └─────────────────────────────────────────────────────────┘

Wichtig: Das Wechseln des Layer-2-Providers löscht nicht Layer 1. Die nativen Markdown-Files und die Session-Datenbank laufen unter jedem Provider weiter. Layer-3-Plugins sind additiv über beide Schichten. Der Atlas-Guide ergänzt zwei klärende Punkte: (1) Memory-as-Skill ist kein Pattern - Skills, die "Memory" anbieten (z.B. Mnemosynes SKILL.md), sind Wrapper um Plugins; seriöse persistent memory läuft über das MemoryProvider-ABC. (2) GBrain belegt einen anderen Slot (Weltwissen als Markdown-Vault) und kann neben einem Layer-2-Provider laufen. Neu in der offiziellen Memory-Doku: write_approval (Freigabe-Gate für Memory-Writes, /memory pending), Hintergrund-Self-Improvement-Review, /journey (Lernpfad-Ansicht, Pruning).

Offizielle Memory-Provider (Layer 2) - Übersicht

Details aus der offiziellen Memory-Providers-Doku (Stand 20.09.2026):

Provider Architektur / Modus Lokal? Tools Quelle
Honcho AI-native Dialectic User Modeling, Two-Layer Context Injection; Konfig-Knobs: contextCadence, dialecticCadence, dialecticDepth; Headless-Device-Auth für Remote-Maschinen Cloud oder Self-Hosted 5 (profile, search, context, reasoning, conclude) Docs ↗
Mem0 Serverseitige LLM-Fakt-Extraktion mit Dedup. 3 Modi: Platform (Cloud), Self-Hosted Dashboard (Docker), OSS (in-process mit eigenem LLM + Vector Store) Cloud / Self-Hosted / OSS 4 (search, add, update, delete) Docs ↗
Hindsight Long-Term Memory mit Knowledge Graph, Entity Resolution, Multi-Strategy-Retrieval; reflect-Tool für Cross-Memory-Synthese (behält vollständige Turns inkl. Tool-Calls) Cloud (ui.hindsight.vectorize.io) oder lokal (embedded PostgreSQL) 3 (retain, recall, reflect) Docs ↗
Supermemory Semantisches Langzeitgedächtnis, Profil-Recall, Session-Capture (1 Dokument je Session je 4h-Fenster) Cloud oder Self-Hosted 4 (store, search, forget, profile) Docs ↗
OpenViking Context-Datenbank von Volcengine (ByteDance): Filesystem-Hierarchie, tiered Retrieval, Auto-Extraktion in 6 Kategorien; AGPL-3.0 Self-Hosted 6 (search, read, browse, remember, forget, add_resource) Docs ↗
Holographic Lokaler SQLite-Fakt-Store mit FTS5, Trust Scoring, HRR (Holographic Reduced Representations) für kompositionale Abfragen; NumPy optional 100% lokal 2 (fact_store mit 9 Actions, fact_feedback) Docs ↗
RetainDB Cloud-Memory-API: Hybrid Search (Vector + BM25 + Reranking), 7 Memory-Typen, Delta Compression; $20/Monat Cloud 10 (profile, search, context, remember, forget + 5 File-Tools) Docs ↗
ByteRover Persistent memory via brv-CLI: hierarchischer Knowledge Tree, tiered Retrieval (fuzzy → LLM-Search); lokal-first, optionaler Cloud-Sync Lokal (Default) 3 (brv_query, brv_curate, brv_status) Docs ↗ · byterover.dev ↗

📦 Offizielle Optionale Skills (RAG-relevant)

Qmd - Query Markup Documents

⭐ 29.901 (tobi/qmd) · Release v2.8.3
Official Skill 100% Local BM25 + Vector + LLM Reranking MCP Integration (5 Tools)
Komplette lokale Suchmaschine für persönliche Knowledge Bases. Indext Markdown/Text/Code, bietet hybride Suche (BM25 + Vektor + LLM-Reranking). Erstellt von Tobi Lütke, MIT-lizenziert. Die empfohlene Default-Lösung für RAG mit Hermes. Repo jetzt unter github.com/tobi/qmd (vorher im NousResearch-Repo verlinkt).
  • 3 Suchmodi: search (BM25, ~0.2s), vsearch (semantic, ~3s), query (hybrid+reranking, ~2-3s warm / ~19s cold); dazu get/multi-get für Volltextabruf
  • 3 lokale GGUF-Modelle: EmbeddingGemma 300M + Qwen3 Reranker 0.6B + Query Expansion 1.7B (~2GB)
  • MCP-Integration, jetzt 5 Tools: mcp_qmd_search, mcp_qmd_vsearch, mcp_qmd_deep_search, mcp_qmd_get, mcp_qmd_status
  • Neu dokumentiert: HyDE-Modus (Hypothetical Document Embeddings), Query-Syntax (lex:/vec:/expand:), Multi-Mode-Queries
  • Pipeline-Details: Query Expansion (1.7B, 2 Alternativen, Original 2x gewichtet), paralleles BM25+Vector, RRF-Fusion (k=60), Qwen3-Reranker auf Top-30, Position-Aware Blending (Rank 1-3: 75/25, Rank 4-10: 60/40, ab Rank 11: 40/60)
  • Chunking: ~900 Token, 15% Overlap, Code-Blöcke werden nie gesplittet
  • Multilingual: Embedding-Override generisch via QMD_EMBED_MODEL für CJK/Multilingual-Content

Chroma - Open-Source Embedding Database

⭐ 24.300+ · v1.3.3
Official Skill Local (Python) Vector DB Metadata Filtering
Open-Source Embedding-Datenbank für AI-Anwendungen. Speichert Embeddings + Metadaten, bietet Vektor- und Volltextsuche, Metadaten-Filterung. Simple 4-Operationen-API (create/add/query/get). Skaliert vom Notebook bis zum Production-Cluster. Building Block - keine eigene RAG-Pipeline oder MCP. Skill-Doku nennt jetzt zusätzlich einen JS/TS-Client (chromadb + @chroma-core/default-embed).
  • Best für: lokale Entwicklung, Open-Source-Projekte, Prototypen
  • Kein MCP-Server → via execute_code oder Custom MCP-Wrapper nutzen
  • Install: hermes skills install official/mlops/chroma
  • Doku empfiehlt Alternativen je Anwendungsfall: Pinecone (managed), FAISS (reine Similarity), Weaviate (production), Qdrant (Performance)

Qdrant - Vector Similarity Search Engine

Offiziell
Official Skill Rust (Self-hosted/Cloud) Production Vector DB Hybrid Search
Hochperformante Vector Database in Rust. Production-grade mit Sharding/Replikation, hybride Suche (Vektoren + Metadaten-Filterung), Multi-Vector-Storage (dense + sparse je Record), Quantisierung (scalar/product/binary). Building Block - keine eigene RAG-Pipeline. Für Production-RAG-Systeme mit niedriger Latenz und horizontaler Skalierung.
  • Best für: Production RAG, niedrige Latenz, horizontale Skalierung, On-Premise
  • Install: hermes skills install official/mlops/qdrant
  • REST + gRPC APIs; qdrant-client Python-Paket

FAISS - Billion-Scale Similarity Search Neu im Katalog

Offiziell
Official Skill Local (faiss-cpu/gpu) HNSW GPU Acceleration
Facebook AI's Library für Billion-Scale Vector Similarity Search. Reine Such-Bibliothek (kein Server, keine Persistenz-Schicht) für maximale Raw-Speed in Forschung und Batch-Verarbeitung. Building Block.
  • Install: hermes skills install official/mlops/faiss
  • Dependencies: faiss-cpu, faiss-gpu, numpy
  • Tags laut Katalog: RAG, Similarity Search, Billion-Scale, HNSW, K-NN

Pinecone - Managed Vector Database Neu im Katalog

Offiziell · Skill v1.0.1
Official Skill Managed Cloud Hybrid Search Auto-Scaling
Managed Vector DB für Production-RAG ohne Eigenbetrieb (Serverless, Auto-Scaling). Für Teams, die Zero-Ops bevorzugen. Parallel existiert im MLOps-Zweig die allgemeine Pinecone-Referenz und im Research-Zweig der agent-fokussierte Skill (siehe unten).
  • Install: hermes skills install official/mlops/pinecone
  • Author: Orchestra Research, MIT, Linux/macOS/Windows

Pinecone Research - Agent RAG + Long-Term Memory Neu im Katalog

Offiziell · Skill v1.0.0
Official Skill Managed Cloud Agent Memory Namespace Session Memory
Agent-fokussierter Pinecone-Skill: persistiert Embeddings, ruft relevanten Kontext aus vergangenen Sessions ab und baut Long-Term Memory auf - inklusive Namespace-basierter Session-Memory. Dependencies: pinecone-client, langchain-pinecone, langchain-openai.
  • Install: hermes skills install official/research/pinecone-research
  • Author: immuhammadfurqan, MIT
  • Abgrenzung: mlops/pinecone für generische Infrastruktur, research/pinecone-research für Agent-RAG

🔧 Community-Projekte (Layer 3)

Diese Projekte gehen über die offiziellen Provider hinaus und implementieren eigenständige RAG/Memory-Lösungen für spezifische Anwendungsfälle. Sortiert nach Community-Rezeption (Stars/Reife). Sternzahlen: GitHub, 20.09.2026.

Mnemosyne - Zero-Cloud AI Memory

⭐ 3.212 · 1.344 Commits · PyPI v3.15.1
Community 100% Local (SQLite) Sub-Millisecond MCP + Native Provider One Pure-Python Dependency
Universelle, Hermes-first Memory-Layer. Funktioniert mit jedem Agent-Framework (Claude Code, Cursor, Codex, OpenWebUI, OpenClaw, Pi). Ein pip install, eine SQLite-Datenbank. Keine externen Services. Wichtiges Update seit Juni 2026: Das Repo ist umgezogen zu mnemosyne-oss/mnemosyne; der Hermes-Wrapper (mnemosyne-hermes, v0.7.1) ist "native, ships enabled". Architektur: Working Memory → Episodic Memory (BEAM) → Temporal Knowledge Graph (TripleStore). Neu: MIB-Binarisierung komprimiert 384-dim-Embeddings auf 48 Bytes (32x), Hamming-Distanz in SQLite, keine ANN-Indizes, keine externe Vector DB.
  • Install: pip install mnemosyne-memory[all] + hermes config set memory.provider mnemosyne
  • RAM-Profile: core ~50MB (Remote-Embedding-API) / [embeddings] ~800MB (FastEmbed lokal) / [all] ~1.5GB (+ lokale LLM-Konsolidierung)
  • Benchmarks (README): Recall@10 konstant 20% von 100k bis 1M Messages bei 372-493ms Latenz; bei 10M Messages 35ms (BEAM-Direct), Storage sub-linear (Episodic-Kompression, 9.4x Einsparung)
  • Hybrid-Gewichtung laut Awesome-Liste: 50% Vektor / 30% FTS5 / 20% Importance; time-aware Fact-Invalidation
  • Default-Embedding: BAAI/bge-small-en-v1.5; multilingual: paraphrase-multilingual-MiniLM-L12-v2, intfloat/multilingual-e5-large oder bge-m3 via MNEMOSYNE_EMBEDDING_MODEL
  • Standalone MCP-Server: mnemosyne mcp (stdio/SSE), Python-SDK from mnemosyne import remember, recall

Memory OS - 7-Layer Memory Operating System

⭐ 1.368 · 50 Commits
Community Local (Docker: Qdrant+Redis) 7-Layer Architecture Provider-Agnostic
Vollständiges Memory Operating System für Hermes Agent. 7 Schichten von Flat Files bis zur Vector Database, mit chirurgischer Context-Injection und einer selbst-kuratierenden Wiki-Pipeline. Läuft komplett lokal, mit jedem LLM-Provider (OpenRouter, OpenAI, Anthropic, Ollama).
  • Layer 1: Workspace (MEMORY.md, USER.md, CREATIVE.md)
  • Layer 2: Sessions (state.db SQLite + FTS5)
  • Layer 3: Structured Facts (memory_store.db, trust scoring)
  • Layer 4: Fabric / Cross-Session (Icarus Plugin, 16 Tools)
  • Layer 5-7: Semantic Search (Qdrant), Auto-Wiki, Context Injection
  • One-command install: curl -sSL https://raw.githubusercontent.com/ClaudioDrews/memory-os/main/setup.sh | bash
  • Voraussetzung: Docker (Qdrant + Redis + ARQ Worker) + Python 3.11+

ClawMem - On-Device Memory Layer

⭐ 210 · 36 Forks · v0.58.0 (verifiziert bis 1.1.0)
Community 100% Local (SQLite) Hybrid RAG (BM25+Vector+Reranking) MCP + Hooks + Hermes Plugin TypeScript/Bun · npm
On-Device Memory für Claude Code, OpenClaw, Hermes und AI-Agents. Alle Integrationswege (Claude Code Hooks, MCP-Server, OpenClaw Plugin, Hermes MemoryProvider-Plugin) schreiben in denselben lokalen SQLite-Vault - ein Decision aus Claude Code ist sofort in Hermes sichtbar. Install jetzt bequem via npm install -g clawmem. Führt aktuelle Forschung zusammen: QMD-derived multi-signal retrieval, SAME-inspired composite scoring, MAGMA-style intent classification, A-MEM self-evolving memory notes, Engram pattern extraction.
  • Multi-Signal Retrieval: BM25 + Vector + Reciprocal Rank Fusion + Query Expansion + Cross-Encoder Reranking; Reranker-Option zerank-2-seq
  • Neu seit Juni 2026: SPO-Knowledge-Graph-Triples als strukturierte Injection (<vault-facts>, v0.9.0), Authorship-Time-Ranking (v0.27.0), clawmem mine mit --synthesize (Fakt-Extraktion aus Chat-Exports, v0.7.2), Session-Focus-Boost, Contradiction-Judge (opt-in via CLAWMEM_JUDGE_*)
  • GGUF-Observer: lokales Modell extrahiert Entscheidungen/Präferenzen/Milestones aus Session-Transkripten
  • Plattform-Support: Linux (primär, systemd Services), macOS (Metal via llama.cpp), WSL2 empfohlen; natives Windows nicht empfohlen
  • Install: npm install -g clawmem (empfohlen) oder bun add -g clawmem

RAG Memory Plugin for Hermes Agent

⭐ 6 · PyPI 1.0.0
Community Local (SQLite + sqlite-vec) Hybrid TF-IDF + Neural Python
Production-grade RAG Memory System mit hybrider TF-IDF + Neural-Suche, automatischer Context-Injection, interaktivem Setup-Wizard und Backup/Recovery. Nutzt sqlite-vec und sentence-transformers.
  • Hybrid Search: TF-IDF + Neural retrieval, <2ms search time
  • Auto-Capture: Hooks injizieren Context vor LLM-Calls, capturen Responses danach
  • Namespace Isolation: Separate Memory-Spaces für Conversations, Files, Projects
  • 20+ CLI Commands: setup, doctor, status, index, search, config, backup, restore
  • Install: curl -sSL https://raw.githubusercontent.com/favouraka/rag-memory-plugin/main/install.sh | bash

Qdrant-Hermes-Integration

⭐ 0 · Stand 20.09.2026
Community Local Qdrant + Cloud Embedding 8 Tools · 10 Modules · 58 Tests Self-healing
Plug-and-Play Qdrant Vector Memory Plugin für Hermes Agent. Semantisches Long-Term Memory via lokalem Qdrant + beliebige OpenAI-kompatible Embedding-API. Auto-scoped Collections, Pre-save Dedup, Recency-weighted Search. Status-Update: Zum Recherche-Zeitpunkt (06/2026) als archiviert geführt; am 20.09.2026 zeigte das Repo keinen Archiv-Hinweis mehr. Praktisch ungenutzt (0 Stars).
  • 8 Tools: qdrant_profile, qdrant_search, qdrant_remember, qdrant_forget, qdrant_index, qdrant_consolidate, qdrant_backfill, qdrant_topics
  • Auto-scoped: Jede Hermes-Instanz + Profil-Kombo bekommt eigenen Namespace
  • Self-healing: Workaround für bekannten Hermes namespace bug
  • Install: curl -sL https://raw.githubusercontent.com/glasschan/qdrant-hermes-integration/main/setup.sh | bash

hermes-rag-complete-deployment (kaiser1103)

⭐ 1
Community Deployment Guide Local (LanceDB) Chromadb · LangChain · ONNX
Komplette End-to-End RAG-Plugin-Deployment-Anleitung für Hermes Agent. Deckt Installation, Konfiguration, Chunking-Optimierung und Auto-Import ab. Fokussiert auf das interne cpu_rag Plugin (LanceDB + BAAI/bge-small Embeddings). Enthält Markdown-Header-aware Chunking, Batch-Import-Scripts und Inkrementelle Updates.
  • Verwendet Hermes' internes cpu_rag Plugin (wenn vorhanden) oder Download
  • Embedding-Model: sentence-transformers/all-MiniLM-L6-v2 oder BAAI/bge-small-zh-v1.5
  • Vector DB: LanceDB (embedded)
  • Chunking: MarkdownHeader-aware (h1-h4) + RecursiveCharacterTextSplitter fallback
  • Auto-Inkrementeller Import via SHA256-Hash-Dedup

Weitere Community-Provider seit Juni 2026 (Kurzatlas)

Die awesome-hermes-agent-Liste (5.714 ★) hat die Layer-3-Slot-Erweiterungen deutlich vergrößert. Auswahl (Status laut Liste, 20.09.2026):

Projekt Ansatz Lizenz
LWC (JanYork) Agent-getriebenes Projekt-Memory: SQLite-Wiki + FTS5, Atomare Changesets, optionaler Doc/Code-Graph, unified lwc serve --mcp Apache-2.0
Lians Bitemporale Fakten (was war wann wahr), Konflikt-Historie, Memory-Lineage, verifizierbare Retrieval-Receipts; lokal mit SQLite, kein API-Key Apache-2.0
Open Index (DrDroidLab) Strukturierte Context-Layer für Domänen-Agenten: Typed Knowledge Graphs, Hybrid Search, SQLite oder OpenSearch MIT
plur-hermes (plur-ai) Engram-Store als YAML bei ~/.plur/, BM25 + lokale BGE-small-Embeddings, Feedback-Rating, ACT-R-Decay, 22 Tools, kein eigener Netzwerk-Pfad Apache-2.0
hexus (codenamekt) Postgres-Memory-Plugin + standalone MCP-Server; pgvector, lokale MiniLM-Embeddings (kein LLM im Hot Path), Async-Write-Queue BSD-3-Clause
causal-memory (JingxuanC) Rust-Core: Flache Fakten + typisierte Entscheidungs-Edges (caused/enabled/prevented), lokales SQLite je Profil, Store außerhalb des Context-Windows (überlebt Compaction) Apache-2.0
flowstate-qmd (amanning3390) Anticipatory Memory: Prefetch von vermutlich nächstem Kontext vor dem Query (RAG + Vector Search)
hermes-penfield (penfieldlabs) Knowledge-Graph-Provider, 16 Tools, OAuth 2.1 Device Flow, stdlib-only; Plugin MIT, dahinter bezahlter Penfield-Cloud-Service (kein Free Tier) MIT (Plugin)
gbrain (garrytan) Opinionated Brain-Layer: strukturiertes persönliches Weltwissen in einem Markdown-Vault, komplementär zum Layer-2-Provider (laut Atlas-Guide der "Standout" für diesen Slot)
keepnotes · Brainstack · autocontext · hermes-lcm · Tree Ring Memory Weitere Beta-Ansätze: Reflective Notes, Layered Memory-Kernel, Self-Improving Context, Lossless Context Management, Skill-Level Memory-Hygiene

Hinweis: Bei Projekten ohne verifiziertes direktes Repo-URL in der Liste wurde auf die Awesome-Liste als Quelle verlinkt; die dortigen Einträge sind mit [beta]/[experimental] markiert.

📚 Tutorials, Guides & Community-Artikel

The Hermes Agent Memory Guidebook

Kevin Simback (X/Hermes Atlas)
Guide
Definitive Guide zu Memory-Systemen für Hermes Agent (veröffentlicht 23.05.2026 auf X). Vergleicht native Memory, offizielle Memory-Provider (8) und Community-Plug-ins (GBrain, Mnemosyne, Mem0, Hindsight, Honcho, Supermemory). Erklärt das 3-Schichten-Modell, einen Decision-Tree ("How to actually pick?") und Warnsignale für überdimensionierte Memory-Layer (Latenz > 3s, Token-Kosten, widersprüchliche Recalls).

Hermes Agent + RAG知识库:5分钟搭建AI智能问答系统

CSDN Blog (JS-Gate)
Tutorial
Chinesischsprachiges Tutorial: 5-Minuten-Setup eines AI-QA-Systems mit Hermes + RAG. Beschreibt Hermes als "eingebaute komplette RAG-Unterstützung, out-of-the-box" und vergleicht Milvus / Qdrant / Chroma als Vector-Backends. Multi-Plattform (Telegram, Feishu, WeChat). Access-Hinweis: Seite hinter JS-Gate (Volltext nur im Browser lesbar).

Set Up RAG Document Retrieval in Hermes Agent (2026)

fast.io
Setup Guide
Step-by-Step Anleitung zur Konfiguration von Hermes Agent's Qmd-Skill für lokales RAG mit hybrider BM25 + Vector-Suche und LLM-Reranking. Keine Cloud-Dependencies.

Built a 100k-Document RAG System by Hand - Hermes Agent Challenge

dev.to (dannwaneri)
Case Study
Erfahrungsbericht: 100.000+ Dokumente indiziert, hybride BM25 + Vector-Suche auf Cloudflare Workers, Gemma 4 MoE Reflection Layer, MCP-Server mit Durable Objects, multimodale Image-Ingestion mit Llama 4 Scout. Dokumentiert 7 Friction Points beim Setup von Hermes auf Windows. Hermes Agent Challenge Submission.

Lesson 13 - Knowledge Base: RAG & Long-Term Document Management

agentupdate.ai
Tutorial
Tutorial-Lektion über Integration von Hermes Agent mit ChromaDB für skalierbare Long-Term Knowledge Bases. Hands-on: Domain-spezifisches Wissen, Reduktion von Halluzinationen, professionellere Antworten.

MCP for RAG and Agent Memory: How They Work Together

getknit.dev
Conceptual
Erklärt das Verhältnis von RAG (Generierungstechnik) und MCP (Protokoll für Tool-Calls). RAG braucht Vector Search, Chunking und Embedding-Logic; MCP stellt die standardisierte Schnittstelle bereit, über die der Agent die Retrieval-Tools aufruft.

Awesome Hermes Agent - Curated Lists

Community Curated
Resource List
Kuratierte Liste von Skills, Plugins, Memory-Providern, Tools, Surfaces und Guides für Hermes Agent (5.714 Stars, 20.09.2026). Die Hermes Atlas ist ein community-gecurtes Verzeichnis mit qualitätsgefilterten Repositories. Berichtigung: Die im Juni genannte zweite Liste (SamurAIGPT/awesome-hermes-agent) existiert nicht mehr - das Repo wurde entfernt/repurposed.

📊 Feature-Vergleichsmatrix

Klick zum Ausklappen - Vollständige Vergleichstabelle aller Lösungen
Lösung Typ Vector DB Hybrid Search Reranking MCP PDF Native Local-Only Hermes Plugin Setup-Aufwand
Qmd Official Skill SQLite + FTS5 ✅ BM25+Vector ✅ Qwen3 0.6B ✅ Built-in (5 Tools) ✅ Skill/MCP Low (npm)
Chroma Official Skill ChromaDB (embedded) ⚠️ Vector+FTS ⚠️ Via Code Medium
Qdrant (Official) Official Skill Qdrant (Rust) ✅ Vector+Metadata ⚠️ Self-hosted ⚠️ Via Code Medium
FAISS Official Skill faiss-cpu/gpu (Library) ⚠️ Similarity only ⚠️ Via Code Medium
Pinecone (MLOps) Official Skill Pinecone (managed) ✅ Hybrid ❌ Cloud ⚠️ Via Code Low (API-Key)
Pinecone Research Official Skill Pinecone + LangChain ✅ Retrieval ⚠️ LangChain ❌ Cloud ⚠️ Via Code Low (pip)
Mnemosyne Community SQLite + sqlite-vec (MIB) ✅ 50/30/20 Hybrid ⚠️ ✅ Native Provider Low (pip)
Memory OS Community Qdrant (Docker) ⚠️ Icarus ✅ Provider High (Docker)
ClawMem Community SQLite ✅ BM25+Vec+RRF ✅ Cross-Encoder / zerank-2 ✅ Provider+MCP Medium (npm/Bun)
RAG Memory Plugin Community SQLite + sqlite-vec ✅ TF-IDF+Neural ⚠️ ✅ Hooks Low (script)
Qdrant-Hermes-Integration Community Qdrant (Docker) ✅ Vector+Recency ⚠️ Embedding API ✅ Provider Low (script)
kaiser1103 RAG Deployment Community Guide LanceDB (embedded) ⚠️ Vector ✅ cpu_rag Medium
Honcho Official Provider Cloud/Self-hosted ✅ Semantic ⚠️ Dialectic ⚠️ ✅ Provider Medium
Mem0 Official Provider Platform/Docker/OSS ✅ +Reranking ⚠️ Platform-Modus ⚠️ OSS/Docker ✅ Provider Low
Hindsight Official Provider Cloud/PG (Knowledge Graph) ✅ Multi-Strategy ⚠️ Reflect ⚠️ Lokal (embedded PG) ✅ Provider Medium

🎯 Empfehlungen nach Anwendungsfall

Anwendungsfall Empfehlung Begründung
Schneller Start, lokal, keine Cloud Qmd npm install, komplette Pipeline, MCP built-in (5 Tools), 3 Suchmodi
Production RAG mit horizontaler Skalierung Qdrant + Custom Pipeline Rust-Engine, Sharding/Replikation, On-Premise, dense+sparse Multi-Vector
Billion-Scale Batch/Similarity (Research) FAISS Maximale Raw-Speed, keine Infrastruktur, GPU-Support
Managed Cloud, keine Ops Pinecone Serverless, Auto-Scaling; Agent-Variante: pinecone-research
Lokales Memory, zero-dependency Mnemosyne SQLite-only, 3.212 Stars, pip install, Hermes-Plugin "native, ships enabled"
Komplettes Memory OS mit Knowledge Graph Memory OS 7-Schichten-Architektur, Qdrant+Redis, Trust Scoring, Auto-Wiki
Cross-Agent Memory (Claude Code + Hermes + OpenClaw) ClawMem Multi-Agent-Support, Hooks+MCP+Plugin, npm install, SPO-Graph, 210 Stars
PDF-Dokumente indexieren Qmd + pymupdf PDFs → Markdown → Qmd Collection. Keine Lösung hat natives PDF-Indexing.
Deutsche Dokumente (VDE-Normen etc.) Qmd + QMD_EMBED_MODEL Embedding-Override für Multilingual-Content; EmbeddingGemma ist English-lastig. Mnemosyne-Alternative: multilingual-MiniLM/e5-large/bge-m3
Cloud-basiert, managed Memory Mem0 / RetainDB / Supermemory Official Provider, kein lokaler Stack nötig; Mem0 auch OSS/Docker-Modi

🔧 Standard-RAG-Pipeline für Hermes

Die bewährte Pipeline für lokale RAG mit Hermes Agent (verifiziert gegen die Qmd-Doku, 20.09.2026):

QUELLEN PREPROCESSING INDEXING QUERY ───────── ────────────── ──────── ───── PDFs ──┐ Markdown ─┼──→ pymupdf/marker-pdf ──→ Qmd Collection ──→ Hermes Chat Text ────┤ (PDF → Markdown) (qmd embed) (mcp_qmd_search) Code ────┘ (Vector + BM25) (mcp_qmd_deep_search) (mcp_qmd_get) ┌─────────────────────────────────────────────────────────────────┐ │ 1. npm install -g @tobilu/qmd │ │ 2. qmd collection add ~/docs --name my-kb │ │ 3. qmd context add qmd://my-kb "Description of collection" │ │ 4. qmd embed │ │ 5. config.yaml → mcp_servers: qmd: command: qmd, args: [mcp] │ │ 6. /reset → mcp_qmd_search / mcp_qmd_vsearch / mcp_qmd_deep_search │ └─────────────────────────────────────────────────────────────────┘

MCP-Konfiguration (config.yaml)

Option A: Stdio (einfach, cold-start ~19s)
mcp_servers: qmd: command: "qmd" args: ["mcp"] timeout: 30 connect_timeout: 45
Option B: HTTP-Daemon (schnell, ~2-3s/query, ~2GB RAM)
# Start daemon (persists across agent restarts) qmd mcp --http --daemon # Runs on http://localhost:8181 by default # config.yaml: mcp_servers: qmd: url: "http://localhost:8181/mcp" timeout: 30

Daemon-Persistenz laut Doku: Linux via systemd user service, macOS via launchd (Konfiguration in der Qmd-Doku).

🔗 Quellenverzeichnis (alle direkten Links)

Alle Links am 20.09.2026 über den Wild-Browser verifiziert (HTTP 200 bzw. Titel bestätigt).

Offizielle Hermes-Doku

GitHub-Repos

Community-Guides & Artikel

PyPI

Anbieter / Projekte