Agent 系统性学习
Search
搜索
暗色模式
亮色模式
阅读模式
探索
论文
此标签下有14条笔记。
2026年8月31日
《Training Compute-Optimal Large Language Models》——Chinchilla 对缩放定律的修正
论文
缩放定律
计算最优
预训练
计算机科学
2026年8月31日
《DeepSeekMoE》——细粒度专家分割与共享专家隔离,回答"激活参数能不能等价稠密参数"
论文
moe
激活参数
稀疏激活
计算机科学
2026年8月31日
《Holistic Evaluation of Language Models》——HELM 与"能力是多维的"这个方法论起点
论文
评测
能力维度
计算机科学
2026年8月31日
《Scaling Laws for Neural Language Models》——缩放定律(Scaling Law)的开山之作
论文
缩放定律
预训练
计算机科学
2026年8月31日
《NoLiMa》——13 个标称 128K 以上的模型,11 个在 32K 就掉一半
论文
长上下文
评测
计算机科学
2026年8月31日
《ToolLLM / ToolBench》——工具调用是训练出来的,不是参数涌出来的
论文
工具调用
指令微调
计算机科学
2026年8月31日
《τ-bench》——用 pass^k 揭穿智能体的"稳定性塌方"
论文
工具调用
评测
可靠性
计算机科学
2026年8月31日
《The Leaderboard Illusion》——对战榜是可以被玩坏的
论文
榜单
对战榜
刷榜
计算机科学
2026年8月31日
《Will we run out of data?》——数据墙(Data Wall)与过训练的经济学
论文
数据墙
过训练
缩放定律
计算机科学
2026年8月31日
《Are Emergent Abilities a Mirage?》——涌现能力(Emergent Abilities)反方
论文
涌现能力
评测
计算机科学
2026年8月31日
《Emergent Abilities of Large Language Models》——涌现能力(Emergent Abilities)正方
论文
涌现能力
缩放
计算机科学
2026年8月31日
《Physics of Language Models 3.3》——知识容量缩放定律:每参数 2 bits
论文
知识容量
参数
预训练
计算机科学
2026年8月31日
《Physics of Language Models 3.2》——知识操纵:背得多不等于推得动
论文
知识
推理
思维链
计算机科学
2026年8月31日
《Rethinking Benchmark and Contamination》——改写一下题目,13B 模型就能刷到 GPT-4
论文
评测污染
榜单
计算机科学