Agent 系统性学习

评测

此标签下有14条笔记。

  • 2026年9月21日

    Jev 官方评测与用例地图

    • 计算机科学
    • ai
    • typesafe
    • jev
    • 用例地图
    • 评测
    • 基准测试
  • 2026年8月31日

    一致性指标:pass^k 与 pass@k

    • 概念
    • 评测
    • 可靠性
    • 计算机科学
  • 2026年8月31日

    上下文腐坏(Context Rot)

    • 概念
    • 长上下文
    • 评测
    • 计算机科学
  • 2026年8月31日

    偏好对战榜(Chatbot Arena / LMArena)

    • 概念
    • 评测
    • 榜单
    • 计算机科学
  • 2026年8月31日

    指令遵循(Instruction Following)

    • 概念
    • 能力
    • 评测
    • 计算机科学
  • 2026年8月31日

    涌现能力(Emergent Abilities)

    • 概念
    • 缩放
    • 评测
    • 计算机科学
  • 2026年8月31日

    能力维度(Capability Dimensions)

    • 概念
    • 评测
    • 能力
    • 计算机科学
  • 2026年8月31日

    长上下文(Long Context)

    • 概念
    • 长上下文
    • 评测
    • 计算机科学
  • 2026年8月31日

    Terminal-Bench

    • 实体
    • 榜单
    • 智能体
    • 评测
  • 2026年8月31日

    《Holistic Evaluation of Language Models》——HELM 与"能力是多维的"这个方法论起点

    • 论文
    • 评测
    • 能力维度
    • 计算机科学
  • 2026年8月31日

    《NoLiMa》——13 个标称 128K 以上的模型,11 个在 32K 就掉一半

    • 论文
    • 长上下文
    • 评测
    • 计算机科学
  • 2026年8月31日

    《τ-bench》——用 pass^k 揭穿智能体的"稳定性塌方"

    • 论文
    • 工具调用
    • 评测
    • 可靠性
    • 计算机科学
  • 2026年8月31日

    《Are Emergent Abilities a Mirage?》——涌现能力(Emergent Abilities)反方

    • 论文
    • 涌现能力
    • 评测
    • 计算机科学
  • 2026年8月31日

    大模型的参数与能力维度

    • 大模型
    • 参数
    • 缩放定律
    • 评测
    • 计算机科学

© 2026 朱景元