💡 痛点背景 / Background
目前 dsh-desktop 在处理 RAG (检索增强生成) 任务时,通常依赖默认的 Agent Loop 进行全局盲搜。这在实际生产/办公场景中带来了两个明显的隐痛:
- 检索污染与幻觉风险:面对用户的闲聊(Chitchat)或通用时效性问题,系统仍会盲目检索本地向量库,导致 Garbage In, Garbage Out。
- 算力与 Token 成本高昂:在高并发或长文本上下文下,无脑触发重度 Agent 规划会极大地消耗云端/本地 LLM 算力,且增加了首字延迟(TTFT)。
🛠️ 建议方案 / Proposed Solution
建议在 DSH 的最前端(或 Agent 执行链的前置网关)引入基于 NanoJev (或 Jev) 的 System 1 快思考决策路由层。
通过一个轻量级(如 NanoJev 0.6B)、低延迟(~50ms)的非自回归模型作为“看门狗”,实现置信度分流(Confidence-Gated Routing):
- Chitchat / Irrelevant: 前端直接拦截或轻量响应,不触发 RAG。
- Web Search: 路由至联网搜索插件分支,补齐本地知识库的时效性盲区。
- Local RAG: 仅在置信度高于阈值(如 > 0.75)时,才精准将提问送入本地结构化向量库。
📐 架构拓扑示意图 (Architecture)
[User Input]
│
▼
[NanoJev Gateway (System 1, ~50ms)]
│
├─── (Confidence < 0.3) ───► [Chitchat / Fallback Intercept]
├─── (Intent == Web) ─────► [Web Search API / Perplexity / Google] ──► [LLM Generation]
└─── (Intent == Local RAG) ─► [dsh-desktop Structed Vector DB] ─────► [LLM Generation (System 2)]
🚀 预期收益 / Expected Benefits
- 极致的响应延迟:利用 System 1 的条件反射特性,过滤掉 40%+ 的无效检索,大幅提升客户端整体的秒回体验。
- 降本增效:NanoJev 极其轻量,支持在廉价硬件(或本地单卡 CPU/GPU)上跑极高并发,显著压低企业版 (DSH Enterprise) 落地时的算力与 Token 成本。
- 降低幻觉率:前置切断了不相关知识库段落对大模型上下文的语义污染。
💬 其他思考 / Additional Context
这个方案在 Dify 工作流(Workflow)的敏捷编排中已经得到了非常好的效果验证。鉴于目前团队正在紧跟最新的 DSH Core 逻辑,如果在前端路由上能融入这种 NanoJev-Gated RAG 的极简美学,相信能在对抗官方桌面端时,建立起更硬核的“极客与企业级多路由”护城河。
如果团队对这个优化方向感兴趣,我很乐意在 Issue 下贡献具体的 Prompt 定义、State 状态机设计以及测试数据,共同探讨落地可行性!
💡 痛点背景 / Background
目前 dsh-desktop 在处理 RAG (检索增强生成) 任务时,通常依赖默认的 Agent Loop 进行全局盲搜。这在实际生产/办公场景中带来了两个明显的隐痛:
🛠️ 建议方案 / Proposed Solution
建议在 DSH 的最前端(或 Agent 执行链的前置网关)引入基于 NanoJev (或 Jev) 的 System 1 快思考决策路由层。
通过一个轻量级(如 NanoJev 0.6B)、低延迟(~50ms)的非自回归模型作为“看门狗”,实现置信度分流(Confidence-Gated Routing):
📐 架构拓扑示意图 (Architecture)
[User Input]
│
▼
[NanoJev Gateway (System 1, ~50ms)]
│
├─── (Confidence < 0.3) ───► [Chitchat / Fallback Intercept]
├─── (Intent == Web) ─────► [Web Search API / Perplexity / Google] ──► [LLM Generation]
└─── (Intent == Local RAG) ─► [dsh-desktop Structed Vector DB] ─────► [LLM Generation (System 2)]
🚀 预期收益 / Expected Benefits
💬 其他思考 / Additional Context
这个方案在 Dify 工作流(Workflow)的敏捷编排中已经得到了非常好的效果验证。鉴于目前团队正在紧跟最新的 DSH Core 逻辑,如果在前端路由上能融入这种
NanoJev-Gated RAG的极简美学,相信能在对抗官方桌面端时,建立起更硬核的“极客与企业级多路由”护城河。如果团队对这个优化方向感兴趣,我很乐意在 Issue 下贡献具体的 Prompt 定义、State 状态机设计以及测试数据,共同探讨落地可行性!