TTokenySpace
返回 Skills 列表

本地长记忆

面向隐私敏感与离线场景的本地向量记忆系统。基于 LanceDB + 纯本地 embedding(Ollama/nomic-embed-text),实现零外部 API 调用、零数据出域、完全离线可用的语义记忆检索。 核心能力包括本地 embedding 引擎(Ollama nomic-embed-text,毫秒级延...

#中文
0

安装到 Tokeny(自动)

下载 ZIP
安装"localmemo-pro"技能
技能信息:
- 名称: 本地长记忆
- 标识: localmemo-pro
- 描述: 面向隐私敏感与离线场景的本地向量记忆系统。基于 LanceDB + 纯本地 embedding(Ollama/nomic-embed-text),实现零外部 API 调用、零数据出域、完全离线可用的语义记忆检索。 核心能力包括本地 embedding 引擎(Ollama nomic-embed-text,毫秒级延...
- 版本: 1.0.0
下载地址:
https://www.tokeny.space/api/skills/localmemo-pro/download
继续

复制上方内容到 Tokeny 客户端并在会话中发送即可自动安装;也可直接 下载 ZIP并拖动到技能窗口安装。

SKILL.md

本地长记忆(LocalMemo Pro)

零 API、零云端、零数据出域的本地向量记忆系统。基于 Ollama + LanceDB,在本地完成 embedding 生成与语义检索,适合隐私敏感、离线、成本敏感场景。

痛点与对策速查

用户痛点发生场景本系统对策
数据隐私担忧云端 embedding 数据出域纯本地 Ollama embedding,数据不出本机
API 费用高云端 embedding 按 token 收费本地 nomic-embed-text 完全免费
离线不可用无网络时记忆系统瘫痪本地运行,完全离线可用
重复计算浪费相同文本反复生成 embeddingembedding 结果缓存,命中即返回
内存膨胀向量库无限增长占满内存资源占用控制 + 压缩 + 清理
质量担忧本地模型不如云端提供模型选择指南,质量够用且可切换
部署复杂本地栈搭建门槛高一键初始化 + 详细故障排查

本地 vs 云端对比

对比维度云端 API(OpenAI)本地方案(Ollama)
费用按 token 收费完全免费
延迟网络往返 100-500ms本地 10-50ms
隐私数据出域完全本地
离线不可用完全可用
质量text-embedding-3-largenomic-embed-text(足够)
资源占用零本地资源需 2-4GB 内存
部署难度仅需 API Key需安装 Ollama

结论:个人/小团队/隐私场景用本地;追求极致质量且不敏感数据用云端。

架构

┌───────────────────────────────────────────────────────────────┐
│                   LOCALMEMO PRO 本地架构                        │
├───────────────────────────────────────────────────────────────┤
│                                                                │
│  L1 热内存     SESSION-STATE.md    活跃任务上下文(抗压缩)     │
│      ↓                                                         │
│  L2 温向量     LanceDB            本地向量检索(embedding缓存)│
│      ↓         ↑ embedding 由 Ollama 本地生成                  │
│  L3 冷存储     Git-Notes          结构化决策(永久)           │
│      ↓                                                         │
│  L4 精选归档   MEMORY.md + daily/ 人类可读长期记忆             │
│                                                                │
│  全程零外部 API · 零数据出域 · 离线可用                        │
└───────────────────────────────────────────────────────────────┘

快速开始(3 步)

第 1 步:安装本地 embedding 引擎

# 安装 Ollama
# macOS/Linux
curl -fsSL https://ollama.com/install.sh | sh

# Windows: 从 https://ollama.com/download 下载安装包

# 拉取 embedding 模型(约 274MB)
ollama pull nomic-embed-text

# 验证
ollama --version

第 2 步:初始化记忆系统

cd skills/localmemo-pro
npm install
node bin/init.js

初始化创建:

  • SESSION-STATE.md — 热内存
  • MEMORY.md — 长期记忆
  • memory/ — 每日日志目录
  • memory/vectors/ — LanceDB 向量数据库
  • memory/cache/ — embedding 缓存目录

第 3 步:使用记忆工具

# 存储
node bin/memory.js store "用户喜欢深色模式" --importance 0.9 --category preference

# 搜索
node bin/memory.js search "用户界面偏好"

# 统计
node bin/memory.js stats

# 遗忘
node bin/memory.js forget --query "深色模式"

Embedding 缓存机制(差异化核心)

相同文本反复生成 embedding 是本地系统的主要性能瓶颈。本系统实现 embedding 缓存:

文本 → SHA256(文本) → 查缓存目录
                          ├─ 命中 → 直接返回向量(<1ms)
                          └─ 未命中 → Ollama 生成 → 写入缓存(10-50ms)
操作无缓存耗时有缓存耗时命中率(典型)
存储记忆30-50ms<1ms(命中)/ 30-50ms(未命中)70-90%
检索记忆30-50ms × N<1ms × N(命中)60-80%

缓存配置

{
  "embeddingCache": {
    "enabled": true,
    "path": "./memory/cache",
    "maxSizeMb": 500,
    "ttlDays": 90,
    "compression": true
  }
}

缓存达到上限时自动 LRU 淘汰最久未用的 embedding。

模型选择指南

模型大小维度质量速度推荐场景
nomic-embed-text274MB768中高通用推荐
bge-m31.2GB1024多语言/高质量需求
mxbai-embed-large670MB1024英文高质量
all-MiniLM-L690MB384极快资源受限设备

推荐:默认用 nomic-embed-text(质量/速度/大小均衡)。资源紧张用 all-MiniLM-L6,质量优先用 bge-m3。

WAL 写前日志协议

原则:先写状态,再回复用户。 保证崩溃/压缩时不丢上下文。

触发条件写入位置写入时机
用户表达偏好SESSION-STATE.md + memory store回复前
用户做出决策SESSION-STATE.md + Git-Notes回复前
用户给出期限SESSION-STATE.md回复前
用户纠正错误SESSION-STATE.md + lessons.md回复前

资源占用控制(差异化核心)

本地系统最大风险:向量库无限增长导致内存/CPU/磁盘膨胀。

三级资源控制

级别触发条件控制措施
轻度向量数 > 10000自动压缩低重要性向量
中度磁盘 > 500MB归档 90 天前记忆到文件
重度磁盘 > 1GB告警 + 停止写入(仅检索)

维护命令

# 查看资源占用
node bin/memory.js stats --detailed

# 压缩向量库
node bin/memory.js compact

# 清理旧记忆
node bin/memory.js cleanup --before 30d

# 去重
node bin/memory.js dedup

# 导出备份
node bin/memory.js backup ./backups/memory-$(date +%Y%m%d).zip

# 清理 embedding 缓存
node bin/memory.js cache-clean --older-than 30d

Agent 配置集成

在 Agent 配置文件中启用本地记忆插件:

{
  "plugins": {
    "entries": {
      "localmemo-pro": {
        "enabled": true,
        "config": {
          "ollamaUrl": "http://localhost:11434",
          "embeddingModel": "nomic-embed-text",
          "dbPath": "./memory/vectors",
          "cachePath": "./memory/cache",
          "autoRecall": true,
          "autoCapture": false,
          "maxMemoryMb": 500,
          "minImportance": 0.5
        }
      }
    }
  }
}

启用后自动提供工具:

  • memory_recall — 搜索相关记忆
  • memory_store — 存储重要信息
  • memory_forget — 删除记忆

代理行为指令

会话开始时

  1. 读取 SESSION-STATE.md(热内存)
  2. 执行 memory_recall 搜索相关历史
  3. 检查 memory/YYYY-MM-DD.md 近期活动

对话进行中

情境动作
用户给出具体细节先写 SESSION-STATE.md,再回复
重要决策memory_store 存储
表达偏好memory_store --importance 0.9 --category preference
出现错误写入 lessons.md

会话结束时

  1. 更新 SESSION-STATE.md 最终状态
  2. 重要内容移至 MEMORY.md
  3. 创建/更新 memory/YYYY-MM-DD.md

真实场景示例

场景 1:医疗隐私场景

用户:"记录患者对青霉素过敏"
→ 本地 embedding 生成(数据不出域)
→ memory_store:"患者青霉素过敏" importance=1.0 category=medical
→ 存储在本地 LanceDB,符合 HIPAA 合规

后续查询:
  memory_recall query="患者过敏史"
  → 本地检索,零数据外传

场景 2:离线开发场景

环境:飞机上无网络,本地开发

用户:"上次我们怎么解决 CORS 问题的?"
→ memory_recall query="CORS 跨域解决"
→ 本地 Ollama 生成 query embedding(离线)
→ LanceDB 本地检索
→ 召回:"CORS 用代理中间件解决,配置在 middleware/cors.js"
→ 无需网络即可回忆历史决策

场景 3:成本敏感场景

独立开发者,月 API 预算 $0

存储 1000 条记忆:
  云端方案:embedding 费用约 $0.5-1/月
  本地方案:$0(一次性模型下载 274MB)

检索 100 次/天:
  云端方案:embedding 费用约 $0.3/月
  本地方案:$0(embedding 缓存命中后 <1ms)

年度节省:约 $10-15

常见问题 FAQ

Q1:本地 embedding 质量够用吗? A:nomic-embed-text 在 MTEB 基准上表现接近 text-embedding-3-small,对个人/小规模记忆库完全够用。如需更高质量可切换 bge-m3。

Q2:Ollama 占多少内存? A:nomic-embed-text 运行时约 2-4GB 内存。资源紧张可用 all-MiniLM-L6(约 500MB)。

Q3:embedding 缓存会占多少磁盘? A:每条记忆的 embedding 约 3KB(768 维 float32)。10000 条记忆约 30MB,缓存上限可配置(默认 500MB)。

Q4:能和云端方案混用吗? A:可以。重要记忆用云端高质量 embedding,日常用本地。但需注意维度一致性,建议统一用一种。

Q5:向量库损坏怎么办? A:定期 node bin/memory.js backup 备份。损坏后从备份恢复,或从 MEMORY.md + daily/ 重建(记忆内容仍在文件中)。

故障排查

现象排查步骤解决方案
Ollama 连接失败curl http://localhost:11434/api/tagsollama serve 启动服务
模型未找到ollama listollama pull nomic-embed-text
向量搜索无结果node bin/memory.js stats确认已存储记忆;检查 dbPath
内存占用过高node bin/memory.js stats --detailed运行 compact + cleanup
embedding 速度慢检查缓存命中率确认 cache.enabled=true
磁盘满检查 vectors/ 和 cache/ 大小清理缓存 + 归档旧记忆
检索质量差检查 minScore 设置降低 minScore 到 0.25;换更大模型

文件结构

workspace/
├── SESSION-STATE.md          # 热内存
├── MEMORY.md                 # 精选长期记忆
├── memory/
│   ├── vectors/              # LanceDB 向量库
│   ├── cache/                # embedding 缓存
│   ├── 2026-07-18.md         # 每日日志
│   ├── lessons.md            # 教训记录
│   └── topics/               # 主题文件
├── bin/
│   ├── init.js               # 初始化脚本
│   └── memory.js             # 记忆管理 CLI
└── localmemo-config.json     # 配置文件

依赖说明

运行环境

  • Agent 平台:支持 SKILL.md 的任意 AI Agent(Claude Code / Cursor / Codex / Gemini CLI 等)
  • 操作系统:Windows / macOS / Linux
  • Node.js:16+(运行记忆管理脚本)
  • 内存:建议 8GB+(Ollama 运行需 2-4GB)
  • 磁盘:建议 2GB+ 可用空间

第三方依赖

依赖项类型是否必需获取方式
LLM APIAPI必需由 Agent 内置 LLM 提供
Ollama本地推理引擎必需https://ollama.com/install
nomic-embed-textembedding 模型必需ollama pull nomic-embed-text
LanceDB向量数据库必需npm install vectordb
Git版本控制可选用于 Git-Notes 冷存储

API Key 配置

  • 本 Skill 核心功能无需任何 API Key
  • 完全本地运行,零外部 API 调用
  • 如需可选的云端备份功能,另行配置对应服务 Key

可用性分类

  • 分类:MD+EXEC(Markdown 指令 + exec 命令行执行)
  • 说明:基于 Markdown 的 AI Skill 驱动 Agent 执行本地记忆管理。核心记忆协议纯 Markdown 可工作;向量检索、embedding 生成需 Ollama + LanceDB 环境。

评论

加载中…