Agent 系统性学习
Search
搜索
暗色模式
亮色模式
阅读模式
探索
计算机科学
此标签下有83条笔记。
2026年9月26日
形式能力与功能能力(Formal vs Functional Linguistic Competence)
概念
哲学
认知科学
大模型
计算机科学
2026年9月26日
机械可解释性(Mechanistic Interpretability)
概念
可解释性
大模型
计算机科学
2026年9月26日
随机鹦鹉(Stochastic Parrot)
概念
哲学
争论
大模型
计算机科学
2026年9月21日
RLCD(Reinforcement Learning for Calibrated Decisions)
概念
训练方法
强化学习
计算机科学
2026年9月21日
RLHF 与 RLVR(Reinforcement Learning from Human Feedback / with Verifiable Rewards)
概念
训练方法
强化学习
计算机科学
2026年9月21日
判别式模型(Discriminative Model)
概念
ai
机器学习
计算机科学
2026年9月21日
双系统理论(System 1 / System 2)
概念
认知科学
推理
计算机科学
2026年9月21日
复合评分(Composite Scoring)
概念
llm
评分
jev
计算机科学
2026年9月21日
并行采样(Parallel Sampling)
概念
ai
推理效率
计算机科学
2026年9月21日
幻觉(Hallucination)
概念
幻觉
类型安全
计算机科学
2026年9月21日
意图路由(Intent Routing)
概念
路由
harness工程
计算机科学
2026年9月21日
投机式扇出(Speculative Fan-out)
概念
llm
并行
jev
计算机科学
2026年9月21日
提示注入(Prompt Injection)
概念
安全
对抗
计算机科学
2026年9月21日
杰文斯悖论(Jevons Paradox)
概念
经济学
成本
计算机科学
2026年9月21日
概率校准(Calibration)
概念
概率
不确定性
计算机科学
2026年9月21日
模型路由(LLM Routing)
概念
llm
路由
jev
计算机科学
2026年9月21日
类型安全(Type Safety)
概念
ai
可靠性
计算机科学
2026年9月21日
系统一模型(System One Model)
概念
ai
模型类别
计算机科学
2026年9月21日
结构化抽取(Structured Extraction)
概念
抽取
类型安全
计算机科学
2026年9月21日
置信度与概率(Confidence vs. Probability)
概念
概率
不确定性
计算机科学
2026年9月21日
置信度门控(Confidence-Gated Routing)
概念
llm
置信度
jev
计算机科学
2026年9月21日
自回归生成(Autoregressive Generation)
概念
ai
生成模型
计算机科学
2026年9月21日
重排序(Reranking)
概念
检索
排序
计算机科学
2026年9月21日
Jev 官方文档
计算机科学
ai
typesafe
jev
官方文档
system-one
模型
2026年9月21日
Jev 官方缺陷清单(jaggedness)
计算机科学
ai
typesafe
jev
模型缺陷
安全
官方文档
2026年9月21日
Jev 官方评测与用例地图
计算机科学
ai
typesafe
jev
用例地图
评测
基准测试
2026年9月21日
Jev 开源复现:Luce、NanoJev、Laya、poorjev 与 SemIf(原 OpenJev)
jev
typesafe
开源复现
校准
决策模型
计算机科学
2026年9月21日
Jev 独立评测:阈值不可迁移(Janus)、排序校验(jev-orderby-bench)与弃权选项(jev-calibration-audit)
jev
typesafe
独立评测
校准
排序
计算机科学
2026年9月21日
Jev 独立评测:域外校准(jev-ood-calibration)、安全盲测(jev-sec-bench)、维度分解反噬与智能体动作门控
jev
typesafe
独立评测
校准
安全
提示注入
计算机科学
2026年9月21日
TypeSafe 发布博客:System One 与 Jev
计算机科学
ai
typesafe
jev
system-one
发布博客
rlcd
2026年9月21日
Awesome Jev / TypeSafe——61 位贡献者的生态精选清单
jev
typesafe
生态清单
独立评测
计算机科学
2026年8月31日
一致性指标:pass^k 与 pass@k
概念
评测
可靠性
计算机科学
2026年8月31日
上下文腐坏(Context Rot)
概念
长上下文
评测
计算机科学
2026年8月31日
偏好对战榜(Chatbot Arena / LMArena)
概念
评测
榜单
计算机科学
2026年8月31日
工具调用(Tool Use / Function Calling)
概念
智能体
能力
计算机科学
2026年8月31日
思维链(Chain-of-Thought, CoT)
概念
推理
提示工程
计算机科学
2026年8月31日
指令遵循(Instruction Following)
概念
能力
评测
计算机科学
2026年8月31日
推理期缩放(Test-time Scaling / Inference-time Scaling)
概念
推理
缩放
计算机科学
2026年8月31日
模型与框架分责(Model-Harness Responsibility Split)
概念
harness
智能体
计算机科学
2026年8月31日
涌现能力(Emergent Abilities)
概念
缩放
评测
计算机科学
2026年8月31日
混合专家(Mixture of Experts, MoE)
概念
moe
模型架构
稀疏激活
计算机科学
2026年8月31日
知识容量(Knowledge Capacity)
概念
知识
参数
预训练
计算机科学
2026年8月31日
能力维度(Capability Dimensions)
概念
评测
能力
计算机科学
2026年8月31日
量化与蒸馏(Quantization and Distillation)
概念
模型压缩
部署
计算机科学
2026年8月31日
长上下文(Long Context)
概念
长上下文
评测
计算机科学
2026年8月31日
《Training Compute-Optimal Large Language Models》——Chinchilla 对缩放定律的修正
论文
缩放定律
计算最优
预训练
计算机科学
2026年8月31日
Chroma《Context Rot》——18 个模型无一例外:输入越长,表现越不可靠
技术报告
长上下文
上下文工程
计算机科学
2026年8月31日
《DeepSeekMoE》——细粒度专家分割与共享专家隔离,回答"激活参数能不能等价稠密参数"
论文
moe
激活参数
稀疏激活
计算机科学
2026年8月31日
《Holistic Evaluation of Language Models》——HELM 与"能力是多维的"这个方法论起点
论文
评测
能力维度
计算机科学
2026年8月31日
《Scaling Laws for Neural Language Models》——缩放定律(Scaling Law)的开山之作
论文
缩放定律
预训练
计算机科学
2026年8月31日
《NoLiMa》——13 个标称 128K 以上的模型,11 个在 32K 就掉一半
论文
长上下文
评测
计算机科学
2026年8月31日
《ToolLLM / ToolBench》——工具调用是训练出来的,不是参数涌出来的
论文
工具调用
指令微调
计算机科学
2026年8月31日
《τ-bench》——用 pass^k 揭穿智能体的"稳定性塌方"
论文
工具调用
评测
可靠性
计算机科学
2026年8月31日
《The Leaderboard Illusion》——对战榜是可以被玩坏的
论文
榜单
对战榜
刷榜
计算机科学
2026年8月31日
《Will we run out of data?》——数据墙(Data Wall)与过训练的经济学
论文
数据墙
过训练
缩放定律
计算机科学
2026年8月31日
《Are Emergent Abilities a Mirage?》——涌现能力(Emergent Abilities)反方
论文
涌现能力
评测
计算机科学
2026年8月31日
《Emergent Abilities of Large Language Models》——涌现能力(Emergent Abilities)正方
论文
涌现能力
缩放
计算机科学
2026年8月31日
《Physics of Language Models 3.3》——知识容量缩放定律:每参数 2 bits
论文
知识容量
参数
预训练
计算机科学
2026年8月31日
《Physics of Language Models 3.2》——知识操纵:背得多不等于推得动
论文
知识
推理
思维链
计算机科学
2026年8月31日
《Rethinking Benchmark and Contamination》——改写一下题目,13B 模型就能刷到 GPT-4
论文
评测污染
榜单
计算机科学
2026年8月31日
大模型的参数与能力维度
大模型
参数
缩放定律
评测
计算机科学
2026年8月23日
Agent Notes
计算机科学
工程方法
文档
agent
决策记录
2026年8月23日
一切皆插件
计算机科学
架构
插件
agent
harness
2026年8月23日
会话日志单一真相源
计算机科学
架构
事件溯源
agent
上下文
2026年8月23日
时空可组合性
计算机科学
编程范式
类型论
插件架构
2026年8月23日
能力接缝
计算机科学
架构
抽象
agent
harness
2026年8月23日
Claude-Code插件系统与2026演进
计算机科学
ai
agent
harness
插件
claude-code
2026年8月23日
Cordis时空可组合性论文
计算机科学
编程范式
插件架构
类型论
agent
2026年8月23日
DeepSeek-Harness官方仓库与架构
计算机科学
ai
agent
harness
插件架构
deepseek
2026年6月10日
文件即接口
计算机科学
agent
harness工程
上下文工程
2026年5月25日
极简派vs工程派Harness设计对比
计算机科学
ai
agent
harness
2026年5月25日
Agency
计算机科学
ai
agent
2026年5月25日
Harness工程
计算机科学
ai
agent
工程方法
2026年5月25日
Subagent
计算机科学
ai
agent
上下文
2026年5月25日
Anthropic 官方 Agent 构建指南
计算机科学
ai
agent
官方文档
workflow
2026年5月25日
Harness 范式串讲:你的 AI 到底需不需要配 Harness
计算机科学
ai
agent
harness
视频
2026年5月25日
claw0:从零构建 AI Agent 网关
计算机科学
ai
agent
网关
教程
python
2026年5月25日
learn-claude-code:Bash is all you need
计算机科学
ai
agent
harness
教程
claude-code
2026年5月25日
pi-coding-agent最小化设计
计算机科学
ai
agent
自研
极简
tui
2026年5月04日
Agent Skill
计算机科学
ai
agent
协议
2026年5月04日
Agent
计算机科学
ai
agent
2026年5月04日
MCP 模型上下文协议
计算机科学
ai
协议
工具调用
2026年5月04日
上下文工程
计算机科学
ai
agent
工程方法