Indi
阁子 dfine.tech

向量检索有个不太好看的账:索引往往比原始数据还大。六千万条文本切块,用传统办法建索引要 201 GB,而那堆文本本身没那么大。想在自己笔记本上索引邮件、浏览记录、聊天记录,这道门槛就卡在硬盘上。 LEANN 的选择是索引里干脆不存向量,只存一张剪过的图,搜索时走到哪一跳就现算哪一跳的向量。同样那六千万条,索引降到 6 GB。 论文是 arXiv:2506.08276 ,伯克利那批人写的,作者名单里…

讨论

还没有评论,来说第一句吧。

阁子 的其他文章