Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.089 — 2026-10-01
NEWS 约 1 分钟

DuckDB开始用自然语言条件过滤数据

Jev把自然语言判断变成带概率的类型化结果,让DuckDB能像组合普通条件一样做语义筛选。

IMAGE — DuckDB Blog

想从5万条客服工单里找出“客户是否愤怒”,关键词搜索往往不够,逐条让聊天模型写一段回答又难以直接计算。DuckDB博客介绍的Jev换了种做法:它不生成句子,只返回布尔值、固定类别或评分,并附上概率。比如“客户是否愤怒”可以直接变成SQL里WHERE后的判断条件。

这点比“让AI读懂数据”更具体:类型固定后,结果可以继续筛选、分组、排序,也能按概率设门槛,语义判断因此更像一个可组合、可校验的SQL算子。已有DuckDB扩展把它接到CSV、Parquet和数据表上;据该博客转述,Hamilton Ulmer制作的扩展可在约10秒内分类约1000行。Parquet是一种按列存放的分析文件,DuckDB则能直接用SQL查询这类本地文件,无需先部署数据库服务器。

边界也很明确:这些扩展会把行内容发送给第三方API,不适合未经许可共享的数据;多数扩展尚需自行编译,且速度与成本数据主要来自厂商或开发者披露。


供稿材料 SOURCES — 1

← 返回 2026-10-01 · 数据板块