搜论文时,输入准确的模型名,你希望结果一个字都别跑偏;只记得大概意思时,又希望系统能认出不同说法。Papers with Code——汇集机器学习论文、代码和评测结果的平台——用“混合搜索”同时处理这两类需求:把擅长精确匹配的关键词搜索,与按含义找内容的语义搜索结合起来。作者称,两者组合的结果优于任一种单独使用,但未披露具体评测数字。
这套架构的务实之处,是没有另起一套专用搜索系统。团队以通用数据库 PostgreSQL 为底座,借助 pgvector 扩展存储和检索向量,再用 Qwen3-Embedding-0.6B 把论文文字转换成代表含义的一串数字。存量论文的向量由配备 NVIDIA L4 的 Hugging Face Jobs 批量生成;用户搜索时,则由 Hugging Face Inference Endpoints 在线生成查询向量。相关产物存入 Hugging Face Buckets,同一套设施还支持论文页面上的“相关论文”推荐。换句话说,它给工程团队展示了一条可复用的路线:在熟悉的数据库里,把结构化数据、精确词语和语义相似度放到一起。以上细节来自作者 Niels Rogge 的技术说明;他披露自己任职于 Hugging Face,并参与 Papers with Code。