Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.037 — 2026-08-10
REPO 87 STARS 约 1 分钟

法律Agent也有了专门考场

Harvey 开源法律 Agent 专业评测,用真实任务和统一标准检验实务能力。

IMAGE — GitHub Trending(Python·日榜)

一段法律意见写得流畅,不等于它真的能交付。比如让 AI 处理一项并购资料室任务,它不仅要读懂文件,还要按指令完成工作,并覆盖评分标准要求的关键点。法律错误可能影响权利、责任或重大决策,通用问答排行榜很难量出这些差别。

Harvey AI 开源的 Legal Agent Benchmark(LAB,法律 Agent 基准评测)因此把考场搬近真实工作。项目包含两部分:一套任务数据,以及一套执行框架。每项任务配有 Agent 指令、文件和 Rubric——预先写明得分条件的评分量表;执行框架则负责运行 Agent、收集结果并完成评价,让不同系统能在相近条件下受测。

目前最具体的入口是一项完整的并购资料室作业演练,流程覆盖环境设置、查看任务、运行 Agent、评分、审阅报告和比较仪表盘。它的意义不在于再造一张总榜,而是提供一把更贴近法律实务的尺子。项目仍在持续增加和修订任务集与执行框架,因此现阶段更适合把它看作正在建设的专业考场,而非定型的能力结论。


供稿材料 SOURCES — 1
01
harveyai/harvey-labs GitHub Trending(Python·日榜) · REPO
原文 ↗

← 返回 2026-08-10 · 开源板块