由 提供支持autopilot.law公开、透明、可复现的法律大模型评测
法律大模型 Benchmark 完全公开
CorePact 聚焦法律方向,实时同步通用与法律垂直模型在中英法律评测上的表现。榜单、曲线、训练状态一处直达,让每一分进展都可被看见、被验证。
- 法律评测维度
- 9
- 中英混合基准
- 上榜模型
- 16
- 通用 + 法律垂直
- 法律垂直模型
- 9
- 含自研 Lite/Pro/Max
- 评测题量
- 38K+
- 覆盖合同/司考/推理
法律大模型评测榜单
覆盖中英混合法律评测:LegalBench、CUAD、美国律考、BigLaw Bench,以及 LawBench、LexEval、国家法考。点击表头可按对应维度重新排序,并可按模型类型筛选。
当前排序:LegalBench(英) — 英文法律推理综合基准(162 项任务)
| # | 模型 | 开源 | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | 核 CorePact-Legal Max法律垂直 CorePact | 86.3 | 83.7 | 92.6 | 79.2 | 90.4 | 89.1 | 88.4 | 85.9 | 81.7 | 闭源 |
| 2 | O GPT-5.6通用 OpenAI | 85.7 | 78.3 | 92.4 | 77.5 | 91.2 | 91.8 | 73.1 | 70.5 | 64.2 | 闭源 |
| 3 | A Claude Opus 5通用 Anthropic | 83.6 | 80.4 | 90.1 | 78.1 | 89.7 | 90.5 | 70.2 | 67.5 | 60.8 | 闭源 |
| 4 | 核 CorePact-Legal Pro法律垂直 CorePact | 82.4 | 79.1 | 88.5 | 74.8 | 86.9 | 85.3 | 84.7 | 81.3 | 76.2 | 闭源 |
| 5 | G Gemini 3 Pro通用 Google DeepMind | 81.9 | 74.2 | 88.7 | 73.6 | 88.4 | 89.6 | 69.8 | 66.1 | 59.3 | 闭源 |
| 6 | 阿 Qwen 3 Max通用 阿里巴巴 | 76.5 | 70.1 | 79.3 | 62.3 | 80.5 | 82.7 | 78.2 | 74.6 | 68.1 | 开源 |
| 7 | 深 DeepSeek-V3.2通用 深度求索 | 75.8 | 69.4 | 78.1 | 61.5 | 79.8 | 83.4 | 77.5 | 73.9 | 67.2 | MIT |
| 8 | 核 CorePact-Legal Lite法律垂直 CorePact | 74.9 | 71.2 | 78.6 | 64.1 | 81.2 | 80.6 | 80.1 | 76.4 | 70.3 | Apache-2.0 |
| 9 | 智 GLM-5通用 智谱AI | 74.1 | 67.8 | 76.5 | 59.8 | 77.9 | 80.2 | 76.9 | 72.4 | 66.5 | 免费商用 |
| 10 | K Kimi K3通用 Moonshot AI | 73.5 | 66.2 | 75.1 | 58.4 | 76.4 | 79.1 | 75.3 | 71.1 | 65.0 | 免费商用 |
| 11 | 阿 通义法睿法律垂直 阿里巴巴 | 72.3 | 68.5 | 70.4 | 60.2 | 71.5 | 73.8 | 83.9 | 80.7 | 74.8 | 闭源 |
| 12 | 复 DISC-LawLLM法律垂直 复旦大学 | 61.2 | 58.3 | 55.7 | 45.7 | 56.8 | 60.3 | 74.1 | 71.8 | 64.3 | 开源 |
| 13 | 浙 智海-录问法律垂直 浙江大学 | 58.9 | 55.1 | 52.4 | 43.2 | 53.9 | 57.6 | 72.6 | 70.2 | 63.1 | 开源 |
| 14 | 北 ChatLaw法律垂直 北京大学 | 57.3 | 54.8 | 51.2 | 41.8 | 52.4 | 55.1 | 70.9 | 68.5 | 61.7 | 开源 |
| 15 | OS LawGPT法律垂直 开源社区 | 52.1 | 49.7 | 47.8 | 36.5 | 48.6 | 51.2 | 66.4 | 63.9 | 57.2 | 开源 |
| 16 | 北 Lawyer LLaMA法律垂直 北京大学 | 50.4 | 48.2 | 45.1 | 34.9 | 46.2 | 49.7 | 64.8 | 61.7 | 55.4 | 开源 |
数据来源:CorePact 法律评测团队精选整理(LegalBench / CUAD / LawBench / LexEval 等)已同步至数据库 · 最近同步 2026/08/06 08:52
实时训练状态
训练集群通过接口上报,指标写入数据库并同步至此。数据库实时数据 · 更新于 08/04 11:34
CorePact-Legal Lite · 预训练 · loss
训练步 vs 训练 / 验证 loss
训练验证
412K
总吞吐 tokens/s
192
GPU 在用
3.24M
计算核心
2
活跃任务
CorePact-Legal Lite · 预训练
run-1c05 · 64 GPU · 1.08M 核心 · 运行中
step 192,000 / 240,00080%
- loss
- 1.709
- 吞吐 tok/s
- —
- ETA
- 约 36 小时
CorePact-Legal Pro · SFT
run-4a1d · 128 GPU · 2.16M 核心 · 运行中
step 12,400 / 18,00069%
- loss
- 0.913
- 吞吐 tok/s
- 412K
- ETA
- 约 14 小时
数据趋势
CorePact-Legal 系列在法律评测上的跨版本演进,以及训练集群近 24 小时吞吐波动。
Benchmark 版本演进
各版本在核心评测集上的分数
LegalBenchLawBench法考
集群吞吐(近 24 小时)
全集群 tokens/s,单位百万
热门模型速览
按 LegalBench 法律推理得分排列的头部模型,点击查看完整评测记录。
CorePact-Legal Max
CorePact · 1.6T
LegalBench
86.3
LawBench
88.4
BarExam
92.6
法考
81.7
GPT-5.6
OpenAI
LegalBench
85.7
LawBench
73.1
BarExam
92.4
法考
64.2
Claude Opus 5
Anthropic
LegalBench
83.6
LawBench
70.2
BarExam
90.1
法考
60.8
CorePact-Legal Pro
CorePact · 238B
LegalBench
82.4
LawBench
84.7
BarExam
88.5
法考
76.2
Gemini 3 Pro
Google DeepMind
LegalBench
81.9
LawBench
69.8
BarExam
88.7
法考
59.3
Qwen 3 Max
阿里巴巴
LegalBench
76.5
LawBench
78.2
BarExam
79.3
法考
68.1