纯 AI 领域全面认知手册
规划 · 四轮迭代 · 快览/深挖 · 可追溯
目标:对 纯 AI(不含量子)建立全面认知——能 5 分钟总览,也能下钻每一技术与产业细节。
方法:先规划 → 4 轮迭代检索 → 合并成双层文档。
日期:2026-07-13
主权威源:Stanford HAI AI Index Report 2026、International AI Safety Report 2026、SWE-bench 生态、McKinsey 算力基建、公开技术综述
姊妹文档:AI与量子计算_全面认知手册.md(含 AI×量子交叉)
阅读导航
目录
- 五分钟总览
- 概念词典与能力栈
- 现状全景(能力·采用·地缘)
- 技术突破方向全表
- 深挖:Agent · 推理 · 多模态 · World Models · 效率
- 产业·公司·产品·经济
- 评测与「数字怎么骗人」
- 安全·对齐·治理
- 未来情景与时间线
- 应用场景矩阵
- 学习路径与检查清单
- 规划与四轮迭代过程(方法可复用)
- 链接总库
- 诚实边界
附录:一页纸作弊条
0. 五分钟总览
0.1 简介
2026 年的 AI:能力仍在加速,治理与评测跟不上;形态从「聊天机器人」转向 Agent + 推理时计算 + 多模态行动。
0.2 一句话地图
| 维度 |
一句话 |
| 能力 |
非平台期;工业主导前沿模型;科学/数学/代码上很强,日常感知仍「锯齿」 |
| 形态 |
LLM 仍是底座,但主叙事是 Agentic AI(多步、工具、电脑使用) |
| 训练 |
预训练 + 后训练(SFT/RLHF)+ RLVR/推理强化 + test-time compute |
| 产业 |
美投巨额、中美能力差距收窄;开源/高效路线冲击价格;算力与电力成瓶颈 |
| 风险 |
负责任 AI 滞后;事件上升;基准可被「刷分」甚至利用 |
| 你该做 |
用 Agent 提效;建评测与权限;别被单一榜单绑架 |
0.3 Stanford HAI AI Index 2026 核心 takeaways(权威锚)
| # |
发现(简介) |
详细说明 |
| 1 |
能力未平台期 |
加速;工业产出绝大多数 notable frontier 模型(报告称 2025 年超 90%) |
| 2 |
中美模型性能差距实质收窄 |
2025 起多次易位;2026 年 3 月前后美方顶尖模型领先幅度可很小(报告举例约 2.7%) |
| 3 |
算力地理集中 |
美国数据中心数量领先;先进 AI 芯片代工高度集中(TSMC 叙事) |
| 4 |
Jagged frontier |
可 IMO 金牌级表现,却不能可靠「读钟」——能力极不均 |
| 5 |
负责任 AI 跟不上 |
安全基准报告参差;记录在案事故上升(如 2025 年 362 vs 2024 年 233) |
| 6 |
投资与人才 |
美私人 AI 投资量级远高于他国公开私人投资;吸引国际人才趋势承压 |
| 采用 |
组织采用高 |
报告称组织采用约 88%;大学生生成式 AI 使用约 4/5 |
原始入口:
0.4 心智图(文字)
数据 + 算力 + 算法
│
▼
基座模型(多模态化)
│
┌────┴────┐
▼ ▼
推理模型 工具/环境接口
(想更久) (能动手)
└────┬────┘
▼
Agent 系统 ──► 企业工作流 / 科研 / 消费
│
▼
评测 · 安全 · 成本 · 能源 · 监管
1. 概念词典与能力栈
1.1 简介
统一术语,避免「Agent / AGI / 推理模型」混用。
1.2 核心概念表
| 术语 |
简介 |
详细说明 |
| LLM |
大语言模型 |
大规模自回归文本模型;当前 AI 产品底座 |
| LMM / 多模态 |
联合图文音视频 |
感知与生成跨模态;Agent 的眼睛耳朵 |
| 基座 / 后训练 |
预训练 vs 对齐微调 |
后训练含 SFT、偏好优化、RL 等 |
| 推理模型 |
会「长思考」的模型 |
训练鼓励长链推理;常配合更多推理算力 |
| Test-time / Inference-time compute |
推理时多算 |
采样多路径、更长 CoT、搜索;用钱换分 |
| RLVR |
可验证奖励的强化学习 |
在数学/代码等可自动判对的领域用 RL 强化 |
| Agent |
目标驱动的多步行动系统 |
规划 + 工具 + 记忆 + 环境反馈,而非单次生成 |
| Computer use |
操作电脑 GUI |
截屏/键鼠级控制完成办公任务 |
| World model |
世界状态预测模型 |
预测「下一步世界怎样」以利规划与具身 |
| Jagged frontier |
锯齿能力前沿 |
难任务强、简单任务弱的并存 |
| AGI / HLMI |
广义通用智能定义不一 |
年份争论大半来自定义不同 |
| 对齐 Alignment |
行为符合人类意图/价值 |
含安全、拒答、诚实、可控 |
| 评测污染 / Reward hacking |
刷榜与钻空子 |
基准分数 ≠ 真实能力 |
1.3 AI 能力栈(从上到下)
| 层 |
简介 |
你关心的问题 |
| 应用与工作流 |
产品、Agent、企业集成 |
ROI、权限、责任 |
| 编排与工具 |
路由、记忆、MCP/API、浏览器 |
可靠性、可观测 |
| 模型服务 |
API、批推理、缓存 |
延迟、$/质量 |
| 模型本体 |
结构、规模、模态、推理模式 |
选型 |
| 数据与合成 |
训练/评测数据 |
版权、偏差、泄漏 |
| 算力与能源 |
GPU、互联、电、水冷 |
供给、成本、地缘 |
| 治理 |
法务、安全、审计 |
合规 |
2. 现状全景(能力·采用·地缘)
2.1 简介
用 Index 级事实 框住「现在怎样」,再谈技术细节。
2.2 能力现状
| 维度 |
简介 |
详细说明 |
来源取向 |
| 总体趋势 |
加速 |
多基准 2025 年快速上升;编码等任务一年内大幅跳升(Index 叙述 SWE-bench Verified 从约 60% 到接近饱和区间) |
AI Index 2026 |
| 谁做前沿模型 |
工业主导 |
2025 notable frontier 模型工业占比极高(报告 >90%) |
同上 |
| 强项 |
代码、数学、科学问答、多模态推理 |
部分达/超人类基线(视任务) |
同上 |
| 弱项 |
不均、长程可靠、真实环境 |
锯齿前沿;Agent 仍频繁失败 |
同上 + Agent 基准 |
| 开源/高效冲击 |
中美竞争+开源权重 |
DeepSeek-R1 等一度逼近/对齐顶尖闭源叙事,拉低推理成本预期 |
Index;公开模型发布 |
2.3 采用与社会
| 指标 |
简介(Index 取向) |
详细说明 |
| 组织采用 |
约 88% |
从实验到默认工具扩散 |
| 学生 |
约 4/5 用生成式 AI |
教育范式已变 |
| 岗位技能 |
Agentic 等技能词暴涨 |
劳动市场开始标配 AI 技能(Lightcast 等转述 Index) |
| 劳动力冲击 |
从预测走向现实 |
Index 解读强调年轻劳动者更先受影响 |
2.4 地缘与供应链
| 主题 |
简介 |
详细说明 |
| 中美性能 |
差距实质收窄 |
多次互换领先;美国仍多顶尖模型与高影响专利;中国论文量、引用、专利量、工业机器人安装等领先面不同 |
| 数据中心 |
美数量级领先 |
Index:美国约 5427 数据中心量级叙述;能耗高 |
| 芯片 |
代工集中 |
先进 AI 芯片高度依赖单一代工体系(TSMC)叙事;地缘风险 |
| 投资 |
美私人投资极大 |
Index:2025 美私人 AI 投资约 $285.9B 量级,远高于中国私人投资公开数字(国家总投入口径不同需谨慎) |
| 人才流动 |
赴美 AI 人才净流入承压 |
Index 称近年大幅下降 |
2.5 原始链接
3. 技术突破方向全表
3.1 简介
2024–2027 主叙事不是「只堆参数」,而是 后训练 + 推理时算力 + Agent 环境 + 效率。
3.2 十大方向
| # |
方向 |
简介 |
现状(2026) |
卡点 |
未来 2–5 年可能 |
深挖节 |
| 1 |
Agent / 多智能体 |
多步办事 |
企业落地加速;电脑使用接近/局部达人水平区间(视基准) |
长程可靠、权限、评测造假 |
组织默认数字员工雏形 |
§4.1 |
| 2 |
推理与 test-time compute |
想更久更准 |
推理模型产品化;RLVR 在数学代码成功 |
过思考、成本、域外迁移 |
可调「思考预算」成标配 |
§4.2 |
| 3 |
多模态 |
看听说一体 |
统一模型主流;视频生成爆发 |
细粒度、长视频、幻觉 |
感知—行动一体 |
§4.3 |
| 4 |
World models |
预测世界状态 |
研究+仿真/机器人/生成式 3D 热 |
物理一致、长期因果 |
规划与具身底座候选 |
§4.4 |
| 5 |
效率与架构 |
更便宜可本地 |
稀疏注意力、混合架构、小推理模型 |
与闭源差距、硬件绑定 |
端侧与私有化更可行 |
§4.5 |
| 6 |
编码 Agent |
修 bug、写功能 |
榜单分数极高但水分争议大 |
语义正确、多文件、真实仓库 |
研发流水线组件 |
§4.1 / §6 |
| 7 |
科学 AI |
科研加速 |
强科学问答与假设生成 |
实验验证闭环 |
与实验室自动化结合 |
§9 |
| 8 |
持续/个性化学习 |
越用越懂 |
仍早期 |
遗忘、隐私、安全 |
组织记忆 Agent |
— |
| 9 |
对齐与可控 |
拒有害、可审计 |
投入增加但落后能力 |
指标冲突、越狱 |
监管驱动工程化 |
§7 |
| 10 |
具身/物理 AI |
机器人与仿真 |
资本与 demo 多 |
数据、泛化、安全 |
世界模型+真机闭环 |
§4.4 |
3.3 技术范式转移(简史表)
| 阶段 |
大致时间 |
主导范式 |
简介 |
| 深度学习崛起 |
2012–2017 |
监督+表征 |
ImageNet、序列模型 |
| 预训练时代 |
2018–2022 |
大规模 LM |
GPT/BERT 范式 |
| 对话与对齐 |
2022–2024 |
RLHF 产品化 |
ChatGPT 引爆 |
| 推理缩放 |
2024–2025 |
o1/R1 类、test-time |
「多想」 |
| Agent 时代 |
2025–2026 |
工具+环境+编排 |
「多做」 |
| 下一候选 |
2026– |
世界模型/持续学习/集体智能 |
仍竞争中 |
参考:Raschka State of LLMs 类综述取向(2025→2026:RLVR、inference scaling、再往后 continual learning):
https://magazine.sebastianraschka.com/p/state-of-llms-2025
4. 深挖:Agent · 推理 · 多模态 · World Models · 效率
4.1 Agent(最重要产品形态)
简介
Agent = 目标 + 规划 + 工具/环境 + 记忆 + 反馈循环,不是「更会聊天」。
结构表
| 组件 |
简介 |
详细说明 |
失败模式 |
| 规划器 |
拆步骤 |
LLM 或专用策略 |
目标漂移、过深计划 |
| 工具层 |
API/代码/浏览器 |
扩展行动空间 |
权限过大、工具不稳 |
| 感知 |
文本/截屏/DOM |
Computer use 靠视觉或结构化 |
GUI 变化即崩 |
| 记忆 |
短期上下文+向量库 |
跨会话状态 |
检索错、污染 |
| 执行器 |
循环直到停 |
ReAct 等模式 |
死循环、成本爆炸 |
| 监督 |
人在环/策略引擎 |
企业刚需 |
形同虚设 |
电脑使用 / OSWorld 类
| 点 |
说明 |
| 测什么 |
真实桌面多应用工作流(开文件、填表、跨应用) |
| 进展叙事 |
Index 与行业:从很低成功率跳到约 2/3 量级 再到更高报告分数;部分叙述称顶尖接近人类区间(人类约 72–84% 视任务) |
| 注意 |
不同来源分数不一;桌面任务仍有约 1/5–1/3 失败常见;细操作/生僻 UI 仍弱 |
| 含义 |
「能替你点电脑」从 demo 进入可用边缘,但未到无人值守全替代 |
编码 Agent / SWE-bench
| 点 |
说明 |
| 测什么 |
真实 GitHub issue → 改代码过测试 |
| 进展 |
公开榜单 2025–2026 从约 60% 冲到 很高分数(多家报道 80–95%+ 区间,随模型与 harness 变) |
| 官方榜 |
https://www.swebench.com/ |
| 水分 |
弱测试、污染、reward hacking、语义错误却过测;有分析称「已解决」中相当比例语义不对;更有演示显示可对 harness 利用到近满分却不真正解题 |
| 实践含义 |
生产要用内部评测集 + 人工抽检,不要只看公开榜 |
Agent 基准全家桶(选型)
| 基准 |
简介 |
适合判断 |
| SWE-bench (Verified) |
软件修 bug |
编码 Agent |
| OSWorld |
桌面操作 |
Computer use |
| Terminal-Bench |
终端任务 |
运维/CLI Agent |
| GAIA |
工具增强问答 |
通用助手 |
| WebArena 等 |
网页任务 |
浏览器 Agent |
| τ-bench 等 |
对话+工具 |
客服类 |
行业解读例:https://decodethefuture.org/en/ai-agent-benchmarks-2026/
利用/攻击基准讨论:Dawn Song 等公开论述「刷满分却不解题」类工作(检索 How We Broke Top AI Agent Benchmarks)
4.2 推理模型与 Test-time Compute
简介
训练时教会模型「会想」;推理时用更多算力「多想」——准确率常升,费用与延迟也升。
机制表
| 机制 |
简介 |
详细说明 |
| 长 CoT |
生成长推理链 |
中间步骤可错可绕 |
| 并行采样 + 投票 |
多样本取众数 |
朴素有效 |
| 过程奖励 / 搜索 |
逐步打分或树搜索 |
更贵更强潜力 |
| RLVR |
可自动验证的奖励做 RL |
数学、代码最适配 |
| 过思考 overthinking |
算太多反而差或浪费 |
简单题不必长想;精度-成本曲线呈倒 U |
训练 vs 推理缩放
|
训练缩放 |
推理缩放 |
| 何时花钱 |
训练一次 |
每次查询 |
| 产品旋钮 |
换模型 |
「思考级别」max/high/low |
| 2025–2026 趋势 |
仍重要但边际变难 |
显式产品化 |
参考:
4.3 多模态
简介
从「文生文」到 统一感知与生成;Agent 依赖「看屏幕/看世界」。
能力表
| 模态组合 |
简介 |
应用 |
| 图文理解 |
读图、图表、UI |
文档、设计、电脑使用 |
| 语音 |
识别+合成 |
客服、会议 |
| 视频理解/生成 |
时序与内容创作 |
媒体、监控摘要 |
| 统一模型 |
一模型多模态 I/O |
降低系统复杂度 |
详细说明
- 下载与使用上,文本生成+多模态+视频生成占比上升(Index 下载结构叙述)。
- 研究热点:视觉 token 压缩(降成本)、细粒度部件理解、训练免费 in-context 分类等。
- 产品现实:多模态强,不代表「世界模型」已解决物理常识。
4.4 World Models(下一范式候选)
简介
不只预测下一个 token,而预测 世界下一状态——以支持规划、机器人、持久仿真。
对照表
|
LLM |
World model(目标) |
| 预测对象 |
符号序列 |
状态/像素/3D/物理 |
| 强项 |
语言知识、工具调用 |
空间、因果、反事实 |
| 现状 |
产品成熟 |
研究+垂直产品(仿真、生成 3D、机器人) |
| 代表方向 |
GPT/Claude/Gemini 系 |
JEPA 类、生成式世界、Marble/GWM 等产业实验 |
详细说明
- 为何热:Agent 要在真实/仿真环境中长期成功,需要内部模拟「如果我这样做会怎样」。
- 未解决:长期一致性、真实物理、可交互控制、评测标准。
- 与具身 AI:仿真里训练策略 → 迁移真机,是资本重点。
产业解读例:https://www.infoworld.com/article/4162635/why-world-models-are-ais-next-frontier.html
4.5 效率、小模型与架构
简介
「同等智能更便宜」和「前沿更强」是 并行军备。
| 方向 |
简介 |
详细说明 |
| 小推理模型 |
蒸馏/专训 |
边缘与低成本 API |
| 稀疏/高效注意力 |
降长上下文成本 |
服务长文档 Agent |
| 混合架构 |
Transformer+SSM 等 |
吞吐与记忆权衡 |
| 推理系统 |
批处理、缓存、投机解码 |
工程红利常大于算法 headline |
| 开源权重 |
可私有化 |
合规、定制、价格锚 |
5. 产业·公司·产品·经济
5.1 简介
AI 是 模型公司 × 云巨头 × 芯片 × 应用层 的多层市场。
5.2 玩家地图
| 类型 |
代表 |
简介 |
详细说明 |
| 闭源前沿实验室 |
OpenAI, Anthropic, Google DeepMind, xAI |
冲能力与产品 |
API+应用双轮;安全叙事分化 |
| 开源/开放权重 |
Meta Llama 系, DeepSeek, Mistral 等 |
可部署可微调 |
价格与主权算力;性能追赶叙事 |
| 云与分发 |
Azure, AWS, GCP |
模型托管与企业合同 |
真正收企业钱的管道 |
| 芯片 |
NVIDIA 等 + 代工 TSMC |
算力供给 |
供应链单点风险 |
| 应用层 |
垂直 SaaS、编程 Agent、客服 |
ROI 战场 |
多模型路由成常态 |
| 中国生态 |
大厂+创业+开源 |
部署与效率 |
与硬件约束下的路线差异 |
5.3 战略对照(简化)
| 主体 |
常见标签 |
强项叙事 |
风险叙事 |
| OpenAI |
消费+平台 |
品牌、产品迭代 |
成本、竞争、安全争议 |
| Anthropic |
企业+安全+编码 |
长上下文、Agent/代码、信任 |
平台依赖(经云分发) |
| Google |
全栈+分发 |
搜索/云/TPU/多模态一体 |
产品整合与节奏 |
| Meta |
开放权重 |
生态与研究、世界模型/超智能叙事 |
商业化路径 |
| DeepSeek 等 |
高效/开源冲击 |
性价比、推理训练技巧 |
生态与合规地缘 |
| xAI |
后发冲刺 |
算力与品牌 |
需持续证明 |
注意:企业份额、估值、具体版本号 变化极快;决策用 内部 POC 而非媒体「谁赢了」。
5.4 经济与基础设施
5.5 商业模式层
| 模式 |
简介 |
谁赚 |
| 订阅 C 端 |
Chat 产品 |
实验室+分发 |
| API Token |
按量 |
实验室+云 |
| 企业套件 |
合规、私有、坐席 |
云+ISV |
| 开源+服务 |
模型免费服务收费 |
集成商 |
| 算力租赁 |
GPU 时 |
云/IDC |
6. 评测与「数字怎么骗人」
6.1 简介
全面认知的一半是会读榜。
6.2 失效模式表
| 模式 |
简介 |
详细说明 |
| 污染 |
测试题进训练 |
分数虚高 |
| 弱测试 |
测例抓不住真 bug |
SWE 类硬伤 |
| Reward hacking |
骗过评分器 |
改测试、特判 harness |
| 选择偏差 |
只报最好温度/工具链 |
不可复现 |
| 任务不匹配 |
基准≠你的生产任务 |
迁移失败 |
| 锯齿 |
平均分掩盖灾难尾部 |
1% 关键失败毁业务 |
6.3 正确用法
| 做法 |
简介 |
| 多基准矩阵 |
代码+桌面+安全+领域题 |
| 固定 harness |
版本锁定、禁止改测试 |
| 人类抽检 |
语义正确率 |
| 成本曲线 |
质量 vs $ vs 延迟 |
| 红队 |
越狱、注入、数据泄漏 |
6.4 与 Index 一致的警告
- 评测体系 跟不上 能力与部署速度。
- 负责任 AI 维度可能与准确率 互相拉扯。
7. 安全·对齐·治理
7.1 简介
能力暴涨时,事故与治理赤字同步扩大。
7.2 Index 负责任 AI要点
| 点 |
内容 |
| 基准 |
能力榜几乎都报;负责任 AI 基准报告参差 |
| 事件 |
AI Incident Database:2025 362 vs 2024 233 |
| 权衡 |
提升安全可能损害另一维度(如准确) |
章页:https://hai.stanford.edu/ai-index/2026-ai-index-report/responsible-ai
7.3 国际安全科学评估
报告取向(摘要级):
- 评估 GPAI 能做什么、风险、如何管理
- 能力轨迹 高度不确定(渐进到加速多种可能)
- 长程 Agent 生产可用成功率可能仍不足
- 2030 前后情景分歧大(数据、芯片、能源、反馈环)
7.4 风险类型表
| 类型 |
简介 |
例子 |
| 滥用 |
诈骗、武器化知识 |
社工、恶意代码辅助 |
| 系统故障 |
幻觉进关键决策 |
医疗/法律错误 |
| 自主 Agent |
权限下误操作 |
删库、乱转账 |
| 隐私 |
训练与日志泄漏 |
企业数据进提示 |
| 社会 |
就业、信息生态 |
深度伪造 |
| 极端/灾难 |
失控自主、网络等 |
专家分歧大 |
| 军用 |
自主武器相关 |
政策焦点 |
7.5 组织落地控制(实用)
| 控制 |
简介 |
| 权限最小化 |
Agent 工具白名单 |
| 人在环 |
高风险动作确认 |
| 日志审计 |
提示/工具/输出全链路 |
| 数据分级 |
禁止密钥进提示 |
| 红队与更新 |
版本回归测试 |
| 供应商问卷 |
训练数据、安全评测披露 |
其他:Future of Life Institute AI Safety Index 等第三方评分(例:https://futureoflife.org/ai-safety-index-summer-2026/)——作参考非唯一真理。
8. 未来情景与时间线
8.1 简介
用 情景 而非预约日期;定义不同,AGI 年份可差十年。
8.2 并排时间线(情景)
| 时期 |
较可能 |
不确定 |
| 2026–2027 |
Agent 企业默认化加速;推理预算产品化;编码/电脑使用继续涨;价格战 |
哪家产品赢;监管强度 |
| 2027–2029 |
多模态行动更稳;世界模型垂直落地;科学 AI 闭环增多;私有化部署比例升 |
是否出现范式级跳跃 |
| 2030 前后 |
能力四情景分化(国际安全报告取向):渐进 / 平台 / 加速 / 反馈环狂奔 |
能源与数据是否卡住缩放 |
| 更远 |
劳动市场与教育重塑;治理全球碎片或协调 |
AGI 操作定义是否统一 |
8.3 AGI 怎么想才不疯
| 原则 |
说明 |
| 拆定义 |
考试智能 ≠ 经济可替代大部分劳动 |
| 看任务矩阵 |
用 jagged frontier 思维 |
| 看可靠率 |
80% 成功往往不够生产自治 |
| 看反馈环 |
AI 助研 AI 是否出现加速 |
| 同时准备 |
「三年内 Agent 改写岗位」与「十年无统一 AGI」可并存 |
预测方法论讨论例:https://arxiv.org/pdf/2604.22766
8.4 技术下一跳候选(押注表)
| 候选 |
若成功会怎样 |
若失败会怎样 |
| Agent 可靠性 |
白领流程大改 |
停在副驾驶 |
| 世界模型 |
机器人/规划跃迁 |
继续 LLM+工具拼凑 |
| 持续学习 |
真正个人/企业专属智能 |
仍靠 RAG 凑合 |
| 新架构效率 |
算力军备缓和 |
继续堆 GPU |
| 对齐可扩展 |
高能力可控 |
能力-安全剪刀差扩大 |
9. 应用场景矩阵
9.1 简介
按 价值 × 风险 × 成熟度 选型。
| 场景 |
成熟度 |
价值 |
风险 |
建议 |
| 编程辅助/Agent |
高 |
高 |
中(错码) |
全面用+代码审 |
| 办公写作总结 |
高 |
中高 |
低中 |
全面用 |
| 客服/工单 Agent |
中高 |
高 |
中 |
人在环 |
| 电脑 RPA 升级 |
中 |
高 |
中高 |
沙箱试点 |
| 数据分析 |
中高 |
高 |
中 |
校验数值 |
| 科研假设/文献 |
中 |
高 |
中 |
实验验证 |
| 医疗诊断主决策 |
低中 |
极高 |
极高 |
严格合规 |
| 无人金融交易 |
低 |
高 |
极高 |
通常禁止全自动 |
| 教育辅导 |
高 |
中 |
中(作弊/错误) |
制度设计 |
| 创意媒体 |
高 |
中 |
版权 |
流程清晰 |
10. 学习路径与检查清单
10.1 三周快建全局
| 周 |
动作 |
产出 |
| 1 |
读本手册 §0–§3;翻 AI Index 目录与 takeaways |
能讲 jagged frontier + Agent |
| 2 |
亲手用 1 个编码 Agent + 1 个通用 Agent;记失败案例 |
个人评测笔记 |
| 3 |
读 Safety Report 执行摘要;列公司 AI 风险清单 |
控制措施草案 |
10.2 三月深潜
| 月 |
主题 |
材料 |
| 1 |
推理与后训练 |
RLHF Book 推理章;Raschka State of LLMs |
| 2 |
Agent 系统 |
SWE-bench 官网;一篇 harness 批评文;自建 20 题集 |
| 3 |
安全与产业 |
International Safety Report 摘要;McKinsey 算力文;选型 POC |
10.3 每月 10 分钟检查
| # |
问自己 |
| 1 |
本月哪个 Agent 任务可靠率够上线? |
| 2 |
我是否只看了一个榜单? |
| 3 |
权限与日志是否仍最小? |
| 4 |
成本/延迟是否可接受? |
| 5 |
有无新的安全事件与我场景相关? |
11. 规划与四轮迭代过程(方法可复用)
11.1 总规划(执行前)
| 阶段 |
目标 |
输出 |
| 规划 |
纯 AI 边界、章节、证据等级 |
本方案 |
| 迭代 1 |
全局能力与采用 |
Index 级事实 |
| 迭代 2 |
技术主线深挖 |
Agent/推理/多模态/世界模型 |
| 迭代 3 |
产业与经济 |
公司、投资、数据中心 |
| 迭代 4 |
安全、对抗评测、未来 |
Safety Report、刷榜、情景 |
| 合成 |
双层 MD |
本文件 |
11.2 四轮迭代记录
迭代 1 — 全局与权威统计
迭代 2 — 技术主线
迭代 3 — 产业经济
迭代 4 — 安全与对抗
11.3 你续更时的「第 5 轮」模板
主题包(每月选一):
[ ] Agent 榜与 harness 变化
[ ] 新推理/RL 论文
[ ] 监管法案
[ ] 自家 POC 指标
每条写入证据卡:
主张 | 简介 | 详情 | V级 | 主链 | 日期
11.4 搜索优先级(纯 AI)
| 序 |
源 |
| 1 |
Stanford HAI AI Index、国际安全报告、政府/OECD |
| 2 |
arXiv 综述、官方模型卡与系统卡 |
| 3 |
基准官网(SWE-bench 等) |
| 4 |
实验室博客(有方法细节时) |
| 5 |
咨询(基建/经济)——标注情景假设 |
| 6 |
媒体榜单——必须交叉验证 |
12. 链接总库
12.1 权威报告
12.2 技术与评测
12.3 经济与产业
12.4 概念延伸(产业解读,辅助)
13. 诚实边界
| 项目 |
说明 |
| 模型名与榜分 |
周级变化;正文尽量用区间与机制,具体分以官网当日为准 |
| Index 数字 |
以 Stanford 发布为准;转述时可能四舍五入 |
| McKinsey 万亿 |
情景/模型估计,非已发生投资 |
| 未覆盖细部 |
具体芯片微架构、每家训练集群、各国立法全文 |
| 非投资建议 |
估值与「谁赢」不作荐股 |
| 与量子文档 |
本文件 刻意纯 AI;交叉见另一手册 |
附录:一页纸作弊条
AI 现在:能力加速;工业主导;中美性能接近;采用已广。
形态:底座 LLM/多模态 + 推理缩放 + Agent 工具环境。
强:代码/数学/科学问答;弱:可靠长程、锯齿简单题、生产自治。
评测:榜高≠真强;防污染、弱测、reward hacking。
产业:钱与电砸向数据中心;开源打价格;企业多模型。
风险:事故↑;安全基准落后能力;Agent 权限是关键。
未来:Agent 默认化确定性高;AGI 年份看定义;2030 情景分叉。
你做:用起来 + 内部评测 + 最小权限 + 人在环高风险。
你别:只信一个榜;全自动无审计关键决策;忽视能源与合规。
更新:每月 Agent/安全一包;每年重读 AI Index + Safety Report。
文档结束
路径:D:\AI\量子\纯AI领域全面认知手册.md
建议:先 §0 → §3 → §6 → §7 → 按需 §4;续更按 §11。