Skip to content

[Feature Request] 引入 NanoJev/Jev 前置决策网关优化 Agentic RAG 检索效率与成本 #643

Description

@ziyouzhiyi666888

💡 痛点背景 / Background

目前 dsh-desktop 在处理 RAG (检索增强生成) 任务时,通常依赖默认的 Agent Loop 进行全局盲搜。这在实际生产/办公场景中带来了两个明显的隐痛:

  1. 检索污染与幻觉风险:面对用户的闲聊(Chitchat)或通用时效性问题,系统仍会盲目检索本地向量库,导致 Garbage In, Garbage Out。
  2. 算力与 Token 成本高昂:在高并发或长文本上下文下,无脑触发重度 Agent 规划会极大地消耗云端/本地 LLM 算力,且增加了首字延迟(TTFT)。

🛠️ 建议方案 / Proposed Solution

建议在 DSH 的最前端(或 Agent 执行链的前置网关)引入基于 NanoJev (或 Jev) 的 System 1 快思考决策路由层。

通过一个轻量级(如 NanoJev 0.6B)、低延迟(~50ms)的非自回归模型作为“看门狗”,实现置信度分流(Confidence-Gated Routing):

  1. Chitchat / Irrelevant: 前端直接拦截或轻量响应,不触发 RAG。
  2. Web Search: 路由至联网搜索插件分支,补齐本地知识库的时效性盲区。
  3. Local RAG: 仅在置信度高于阈值(如 > 0.75)时,才精准将提问送入本地结构化向量库。

📐 架构拓扑示意图 (Architecture)

[User Input]
│
▼
[NanoJev Gateway (System 1, ~50ms)]
│
├─── (Confidence < 0.3) ───► [Chitchat / Fallback Intercept]
├─── (Intent == Web) ─────► [Web Search API / Perplexity / Google] ──► [LLM Generation]
└─── (Intent == Local RAG) ─► [dsh-desktop Structed Vector DB] ─────► [LLM Generation (System 2)]

🚀 预期收益 / Expected Benefits

  • 极致的响应延迟:利用 System 1 的条件反射特性,过滤掉 40%+ 的无效检索,大幅提升客户端整体的秒回体验。
  • 降本增效:NanoJev 极其轻量,支持在廉价硬件(或本地单卡 CPU/GPU)上跑极高并发,显著压低企业版 (DSH Enterprise) 落地时的算力与 Token 成本。
  • 降低幻觉率:前置切断了不相关知识库段落对大模型上下文的语义污染。

💬 其他思考 / Additional Context

这个方案在 Dify 工作流(Workflow)的敏捷编排中已经得到了非常好的效果验证。鉴于目前团队正在紧跟最新的 DSH Core 逻辑,如果在前端路由上能融入这种 NanoJev-Gated RAG 的极简美学,相信能在对抗官方桌面端时,建立起更硬核的“极客与企业级多路由”护城河。

如果团队对这个优化方向感兴趣,我很乐意在 Issue 下贡献具体的 Prompt 定义、State 状态机设计以及测试数据,共同探讨落地可行性!

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Type

    No type

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions