Agent 系统性学习
Search
搜索
暗色模式
亮色模式
阅读模式
探索
评测
此标签下有14条笔记。
2026年9月21日
Jev 官方评测与用例地图
计算机科学
ai
typesafe
jev
用例地图
评测
基准测试
2026年8月31日
一致性指标:pass^k 与 pass@k
概念
评测
可靠性
计算机科学
2026年8月31日
上下文腐坏(Context Rot)
概念
长上下文
评测
计算机科学
2026年8月31日
偏好对战榜(Chatbot Arena / LMArena)
概念
评测
榜单
计算机科学
2026年8月31日
指令遵循(Instruction Following)
概念
能力
评测
计算机科学
2026年8月31日
涌现能力(Emergent Abilities)
概念
缩放
评测
计算机科学
2026年8月31日
能力维度(Capability Dimensions)
概念
评测
能力
计算机科学
2026年8月31日
长上下文(Long Context)
概念
长上下文
评测
计算机科学
2026年8月31日
Terminal-Bench
实体
榜单
智能体
评测
2026年8月31日
《Holistic Evaluation of Language Models》——HELM 与"能力是多维的"这个方法论起点
论文
评测
能力维度
计算机科学
2026年8月31日
《NoLiMa》——13 个标称 128K 以上的模型,11 个在 32K 就掉一半
论文
长上下文
评测
计算机科学
2026年8月31日
《τ-bench》——用 pass^k 揭穿智能体的"稳定性塌方"
论文
工具调用
评测
可靠性
计算机科学
2026年8月31日
《Are Emergent Abilities a Mirage?》——涌现能力(Emergent Abilities)反方
论文
涌现能力
评测
计算机科学
2026年8月31日
大模型的参数与能力维度
大模型
参数
缩放定律
评测
计算机科学