问题描述 (Problem Statement):
当前在「设置」页面中,将「上下文长度 (Context Length)」作为一个全局静态的滑动条进行配置(支持 4k - 256k)。该设计存在以下逻辑与体验问题:
模型规格不兼容: 不同 AI 模型(如 Llama 2/3、Qwen 2.5 等)原生支持的最大上下文窗口截然不同(例如 4k、8k、128k 等)。全局统一设置会导致配置值超出某些模型的上限,从而引发推理报错。
显存/内存溢出 (OOM) 风险: 上下文长度对显存(KV Cache)开销极大。用户若在全局随意调大上下文,容易在使用小显存设备时触发 OOM 导致服务崩溃。
场景灵活性差: 全局配置无法满足“日常轻量对话(需要小上下文)”与“长文本/代码分析(需要大上下文)”并存的动态需求。

问题描述 (Problem Statement):
当前在「设置」页面中,将「上下文长度 (Context Length)」作为一个全局静态的滑动条进行配置(支持 4k - 256k)。该设计存在以下逻辑与体验问题:
模型规格不兼容: 不同 AI 模型(如 Llama 2/3、Qwen 2.5 等)原生支持的最大上下文窗口截然不同(例如 4k、8k、128k 等)。全局统一设置会导致配置值超出某些模型的上限,从而引发推理报错。
显存/内存溢出 (OOM) 风险: 上下文长度对显存(KV Cache)开销极大。用户若在全局随意调大上下文,容易在使用小显存设备时触发 OOM 导致服务崩溃。
场景灵活性差: 全局配置无法满足“日常轻量对话(需要小上下文)”与“长文本/代码分析(需要大上下文)”并存的动态需求。