术语表
首次出现附英文原词;按主题聚合。
- LLM(大语言模型):以海量文本与代码预训练的概率生成模型,是各类 AI 编程工具的引擎。
- Token:模型的最小处理单位;中文约 1 字 1-2 token,代码符号密度更高。
- 上下文窗口(Context Window):模型单次请求能读入的 token 总量上限;窗口大不等于可用上下文大(注意力稀释)。
- 注意力预算:把窗口当预算分配的思维模型——每份贴入材料都要挣得位置,最小充分集优先。
- 幻觉(Hallucination):模型编造不存在的事实、API、包名或文献,且表述自信流畅。
- Ghost Text(灰影文本):编辑器补全以灰色虚影展示的建议文本,Tab 接受、Esc 拒绝。
- 采纳率(Acceptance Rate):接受的补全次数 ÷ 展示的补全次数;只反映工具黏性,不反映质量。
- Agent(智能体/编码代理):LLM + 工具 + 循环的组合体,能自主读写文件、执行命令、运行验证并迭代至目标达成。
- 工具调用(Tool Calling):模型在生成过程中调用外部能力(读写文件、执行命令、搜索)的机制。
- 检索增强生成(RAG):先按相关度检索材料再拼入上下文生成的技术;代码库语义检索是其编程场景形态。
- 嵌入(Embedding):把文本映射为向量的表示方法,语义检索按向量相似度召回。
- 语义检索(Semantic Search):按含义(而非字面)相似度检索代码;对精确符号匹配常不如关键词检索,两者互补。
- 规则文件(Rules File):仓库内随会话自动注入的常驻 AI 指令(AGENTS.md / CLAUDE.md / .cursorrules 等)。
- 上下文包(Context Pack):为单个任务打包的最小充分材料集合:任务、代码与行号、接口约定、验收样例、约束禁区、已排除项。
- 意图-约束-验收三元组:对话式编程的可靠表达结构:做什么/为什么、边界与禁区、怎样算完成。
- Spec 驱动开发(Spec-Driven Development):先写可执行规格(目标/接口/行为清单/错误处理/验收条件)再让 AI 实现、按规格逐条验收的工作流。
- TDD(Test-Driven Development,测试驱动开发):红灯-绿灯-重构循环;与 AI 配合的关键是人不放弃测试的意图定义与质量审查。
- 特征测试(Characterization Test):重构前对现有行为快照的测试,证明改动后行为不变。
- 弱断言:不检查实质内容的测试断言(只验证不抛异常、期望值由实现反推),是测试凑答案的信号。
- 依赖幻觉(Package Hallucination):模型推荐实际不存在的包名。
- Slopsquatting:攻击者抢注 AI 常产出的幻觉包名并植入恶意代码,等待受害者安装。
- Typosquatting:仿冒知名包形近名称的恶意包。
- SCA(Software Composition Analysis,软件成分分析):扫描项目依赖、比对已知漏洞库的安全工具类别。
- 许可证家族:宽松型(MIT/BSD/Apache-2.0,义务轻)与著佐权型(GPL/LGPL/AGPL,要求开放衍生源码)两大类。
- 密钥卫生(Secrets Hygiene):密钥不进提示词、AI 产出只用占位符、提交前扫描的三防线纪律与作废-轮换-排查-复盘应急序列。
- 风格漂移(Style Drift):AI 产出引入与仓库既有惯例不一致的第二套写法,是复利型技术债。
- 派工单:给 Agent 的结构化任务书:目标、验收命令、禁区、预算上限、回报格式。
- 跑偏(Drift):Agent 在循环中错误累积、偏离目标的现象;对策是预算 + 信号清单 + 教训落盘重启。
- 沙箱(Sandbox):限制 Agent 副作用半径的隔离环境(容器/临时目录/禁网)。
- DORA 四键:部署频率、变更前置时间、变更失败率、恢复时长——经过大规模实证的软件交付结果层指标。
- Goodhart 定律:「一旦指标成为考核目标,它就不再是好指标」——度量设计不入个人绩效的依据。
- Vibe Coding:以自然语言意图驱动、轻视逐行审查的生成式编程风格;2025 年由 Andrej Karpathy 提出,本库立场是审查纪律不可省。
- MCP(Model Context Protocol):模型与外部工具/数据源连接的开放协议,工具生态标准化的代表。
参考资料
本列表基于模型知识整理,建议按需核对原文。所有条目为真实存在的经典文献;本库不提供 URL,不确定的链接一律不列。
论文
- 《Attention Is All You Need》Vaswani 等,2017 —— Transformer 与注意力机制原始论文,上下文窗口的机制源头。
- 《Evaluating Large Language Models Trained on Code》Chen 等,2021 —— Codex 论文,代码模型能力评估(HumanEval)的奠基之作。
- 《ReAct:Synergizing Reasoning and Acting in Language Models》Yao 等,2022 —— 推理-行动交替循环的代表论文,Agent 循环的思想来源之一。
软件工程经典
- 《Test-Driven Development:By Example》Kent Beck —— 红灯-绿灯-重构循环的原始定义。
- 《Refactoring:Improving the Design of Existing Code(第2版)》Martin Fowler —— 行为保持重构与特征测试的权威方法论。
- 《Code Complete(第2版)》Steve McConnell —— 构建质量与评审检查单方法的经典基线。
- 《Accelerate:The Science of Lean Software and DevOps》Nicole Forsgren 等 —— DORA 四键指标体系与大规模实证。
- 《人月神话(The Mythical Man-Month)》Frederick P. Brooks Jr. —— 「没有银弹」:对工具乐观主义的持久清醒剂。
- 《Pro Git》Scott Chacon & Ben Straub —— 分支模型与历史操作(revert/bisect)权威手册。
认知与伦理
- 《Make It Stick:The Science of Successful Learning》Peter C. Brown 等 —— 提取练习与必要难度,技能保持的学习科学依据。
- 《Debugging:The 9 Indispensable Rules》David Agans —— 调试九律,假设树方法的精神源头。
- 《The Alignment Problem》Brian Christian —— AI 对齐问题的通识经典,伦理判断的概念底座。
许可证文本
- MIT License / Apache License 2.0 / GPL-3.0 / AGPL-3.0 官方文本 —— 义务判断的唯一权威来源,建议至少通读 MIT 与 Apache-2.0 全文。
使用提示
- 本库不绑定任何具体产品的官方文档;产品界面与命令以各产品最新文档为准。
- 引用本库观点做团队规范时,建议回溯上述一手文献核对语境。