Skip to content

[Feature/Refactor] 全局「上下文长度」配置逻辑不合理,建议改为基于模型动态适配或下放到对话层 #95

Description

@NieWuy

问题描述 (Problem Statement):
当前在「设置」页面中,将「上下文长度 (Context Length)」作为一个全局静态的滑动条进行配置(支持 4k - 256k)。该设计存在以下逻辑与体验问题:

模型规格不兼容: 不同 AI 模型(如 Llama 2/3、Qwen 2.5 等)原生支持的最大上下文窗口截然不同(例如 4k、8k、128k 等)。全局统一设置会导致配置值超出某些模型的上限,从而引发推理报错。

显存/内存溢出 (OOM) 风险: 上下文长度对显存(KV Cache)开销极大。用户若在全局随意调大上下文,容易在使用小显存设备时触发 OOM 导致服务崩溃。

场景灵活性差: 全局配置无法满足“日常轻量对话(需要小上下文)”与“长文本/代码分析(需要大上下文)”并存的动态需求。

Image

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Type

    No type

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions