1详细剖析 LLMLingua 基于小模型困惑度 (Perplexity / Conditional Perplexity) 衡量 Token 关键信息量的压缩算法机制?
2LongLLMLingua 如何通过对长文档切块进行 Query-aware 动态预算分配(Dynamic Budget Allocation)解决“迷失在中间”问题?
3句子级抽取式压缩 (Sentence-level Extractor) vs Token 级硬截断压缩 (Token-level Pruning) 在语义连贯性上的对比?
4压缩后文本可能出现语法破碎或代词断裂,现代 LLM 对不完整语法的鲁棒性容忍度与准确率评估?
5在端到端 RAG 延迟链条中,引入 LLMLingua 压缩所需的推理耗时 vs 减少下游生成 LLM TTFT/TPOT 的净收益权衡?