token 超限别急着改模型:一套自动拆分段续传策略的落地设计
一套“预估-拆分-续传”策略解决长文本LLM调用超限问题:用毫秒级保守估算替代精确计算提前判断;按句边界拆分并加入重叠锚点保持语义;通过system prompt注入位置感知实现续传;辅以自适应重试动态缩小分段。实测将300k token输入的处理成功率从60%提升至97%以上。
共 52 篇文章
一套“预估-拆分-续传”策略解决长文本LLM调用超限问题:用毫秒级保守估算替代精确计算提前判断;按句边界拆分并加入重叠锚点保持语义;通过system prompt注入位置感知实现续传;辅以自适应重试动态缩小分段。实测将300k token输入的处理成功率从60%提升至97%以上。
大模型返回的 JSON 不稳定,本质是契约问题。文章提出一套前端容错解析流程:先用三道预检查拦截 Markdown 包裹、非 JSON 文本和控制字符;再按常见破损模式分层修复,如去尾逗号、转义控制字符、补全括号;最后通过 safeParse 实现逐级降级,用字段提取器捞取关键数据,确保页面不崩、核心信息可达。