你想想看,咱们用LLM处理实际任务的时候,是不是经常遇到这种情况——工具调用返回了一大串JSON,日志文件动辄几万行,RAG检索回来的chunk一个比一个长。这些上下文塞进LLM的窗口里,token消耗得像流水一样,但里面真正有用的信息可能连10%都不到。我之前试过各种办法,手动截断吧,怕漏掉关键信息,不截断吧,模型又读不过来。直到我遇到headroom,坦率的讲,它解决的就是这个痛点。…
你想想看,咱们用LLM处理实际任务的时候,是不是经常遇到这种情况——工具调用返回了一大串JSON,日志文件动辄几万行,RAG检索回来的chunk一个比一个长。这些上下文塞进LLM的窗口里,token消耗得像流水一样,但里面真正有用的信息可能连10%都不到。我之前试过各种办法,手动截断吧,怕漏掉关键信息,不截断吧,模型又读不过来。直到我遇到headroom,坦率的讲,它解决的就是这个痛点。…
讨论
登录后参与讨论
还没有评论,来说第一句吧。