token 超限别急着改模型:一套自动拆分段续传策略的落地设计
一套“预估-拆分-续传”策略解决长文本LLM调用超限问题:用毫秒级保守估算替代精确计算提前判断;按句边界拆分并加入重叠锚点保持语义;通过system prompt注入位置感知实现续传;辅以自适应重试动态缩小分段。实测将300k token输入的处理成功率从60%提升至97%以上。
共 1 篇文章
一套“预估-拆分-续传”策略解决长文本LLM调用超限问题:用毫秒级保守估算替代精确计算提前判断;按句边界拆分并加入重叠锚点保持语义;通过system prompt注入位置感知实现续传;辅以自适应重试动态缩小分段。实测将300k token输入的处理成功率从60%提升至97%以上。