大语言模型Large Language Model
读过海量文本、学会「接着往下写」的统计模型——对话、写作、编程能力都由此而来。
通过预测下一个词接受训练。规模足够大之后,表现出翻译、推理、写代码等未被单独教过的能力。当前主流产品(对话助手、代码助手)的底座都是它。
给零基础读者的地基:每个词先给一句大白话,再给一段展开。站内正文出现这些词时 带虚线下划线,悬停或点按即可查看释义,无需跳出阅读。
模型与技术生态的核心概念。
读过海量文本、学会「接着往下写」的统计模型——对话、写作、编程能力都由此而来。
通过预测下一个词接受训练。规模足够大之后,表现出翻译、推理、写代码等未被单独教过的能力。当前主流产品(对话助手、代码助手)的底座都是它。
不止回答问题、还能自己动手完成多步任务的 AI:查资料、调工具、改文件、直到做完。
在大语言模型之上增加工具调用与循环执行:模型自行决定下一步做什么、调用什么工具、何时结束。编码与办公自动化是当前商用最深的场景。
回答前先「打草稿」的模型:多想几步再作答,数学、代码与规划类任务显著更强。
在输出最终答案前生成不展示或部分展示的思考过程,用更多计算换更高正确率。代价是响应更慢、成本更高,适合难题而非闲聊。
模型参数文件公开可下载,任何人可在自己的机器上运行、微调——但训练数据与方法未必公开。
与「开源软件」不同:多数开源权重模型只公开参数,训练数据、配方与完整代码不公开,许可证也可能限制商用。评估可用性时要读许可证而非只看「开源」二字。
同一个模型能同时处理文字、图片、音频、视频——看图说话、听声转写都在此列。
输入与输出不再限于文本。当前落地最广的是图像理解(拍照问答、票据识别)与语音双向(实时转写与合成)。
模型一本正经地编造事实:引用不存在的论文、给出错误的数字,且语气笃定。
源于「预测下一个词」的本质——模型优先输出「像真的」而非「是真的」。检索增强与信源核查能降低但不能消除。本站每条能力陈述挂信源,正是针对这一点的产品化对策。
给模型出的标准化考卷,用同一套题比较不同模型;但高分不等于实际工作可用。
常见基准覆盖数学、代码、常识问答等。注意两点:考题可能混入训练数据(刷分);分数与真实场景表现存在差距。本站将「独立基准测试」列为二级信源,厂商自测不算。
模型一次能「记住」的文本上限——超出窗口的内容它就看不见了。
以 token(约等于汉字或英文词片段)计。窗口越大,能一次读的材料越多,但成本与延迟也随之上升,且超长窗口下的记忆质量并不均匀。
装进身体(机器人)的 AI:不只处理信息,还要在物理世界里看、动、操作。
难点从「答对」变成「做对」:感知误差、物理接触与安全约束都无法靠语料训练完全解决。工业场景(固定流程)先落地,家庭通用场景仍远。
在通用模型上用少量专属数据「再训一层」,让它更懂某个领域或某种口吻。
成本远低于从头训练。适合固定格式输出、领域术语与风格对齐;不适合灌输事实知识(那更适合检索增强)。
读懂行业页信源与证据所需的领域术语(医疗先行)。
筛查指标:真有病的人里,被正确查出来的比例——漏诊率的反面。
与特异度(没病的人里被正确排除的比例)成对使用。只报敏感度不报特异度的宣传要警惕:把所有人都判为阳性也能拿到 100% 敏感度。
医学证据的金标准:预先注册、随机分组、对照比较——回顾性数据说服力远低于它。
「前瞻」指先定方案再收数据(防止事后挑数据),「随机对照」指随机分组消除偏倚。AI 医疗宣称是否可信,首先看有没有这一级证据。
中国医疗器械最高风险类别的上市许可——诊断类 AI 软件须取得三类证才能临床销售。
由国家药监局审批,需临床试验数据。持证数量是观察中国医疗 AI 商用化程度的硬指标。
美国 FDA 为「前所未有的新型器械」设的审批通道——首个自主诊断 AI 就由此获批。
适用于无同类先例、中低风险的新器械。获批后成为后续同类产品的比照基准(predicate)。
美国医疗服务的收费编码——AI 服务拿到专属 CPT 码,意味着可以正式向保险计费。
由美国医学会维护。对 AI 而言,进入 CPT 目录是从「获批可用」到「有人买单」的关键一跃,比监管批准更能预测普及速度。