今年你唯一需要的AI术语表

techcrunch.comGeneral机器翻译07/03 21:20527 阅读

人工智能正在重塑世界,同时也在创造一种全新的语言来描述这一过程。如今,参加任何产品会议、推销会或讨论小组,你都会听到人们随口提及LLM、RAG、RLHF以及其他十多个术语,这些术语甚至会让科技行业中最聪明的人也感到有些不自在。本术语表旨在解决这一问题:用通俗的英文定义来解释你最可能遇到的人工智能术语,无论你是在用这些东西进行开发、投资,还是仅仅通过阅读TechCrunch或收听相关播客来跟上时代。随着该领域的发展,我们会定期更新,因此请将其视为一份活的文档,就像它所描述的人工智能系统一样。


AGI

通用人工智能(AGI)是一个模糊的术语,但它通常指代在众多(如果不是大多数)任务上比普通人能力更强的人工智能。OpenAI首席执行官山姆·奥特曼曾将AGI描述为“你可以作为同事聘用的中等水平人类”。与此同时,OpenAI的章程将AGI定义为“在大多数具有经济价值的工作上超越人类的高度自主系统”。谷歌DeepMind的理解与这两个定义略有不同;该实验室认为AGI是“在大多数认知任务上至少与人类能力相当的人工智能”。困惑了吗?别担心——人工智能研究前沿的专家也是如此。

AI智能体

AI智能体指的是使用人工智能技术代表你执行一系列任务的工具——其能力超出基础AI聊天机器人——例如提交费用报销、预订机票或餐厅座位,甚至编写和维护代码。然而,正如我们之前解释过的,这一新兴领域有很多变化因素,因此“AI智能体”对不同的人可能有不同的含义。为了实现其设想的能力,基础设施仍在建设之中。但基本概念意味着一个自主系统,它可能利用多个AI系统来执行多步骤任务。

API端点

可以把API端点想象成软件背后的“按钮”,其他程序可以按下这些按钮来让软件执行操作。开发人员利用这些接口构建集成——例如,允许一个应用从另一个应用拉取数据,或者让AI智能体无需人工手动操作每个界面,直接控制第三方服务。大多数智能家居设备和联网平台都提供了这些隐藏按钮,即便普通用户从未见过或与之交互。随着AI智能体能力不断增强,它们越来越能够自主发现并使用这些端点,为自动化开辟了强大——有时甚至出人意料——的可能性。

思维链

对于一个简单的问题,人脑甚至无需过多思考就能回答——比如“哪种动物更高,长颈鹿还是猫?”但在许多情况下,你往往需要纸笔才能得出正确答案,因为存在中间步骤。例如,如果一个农民养了鸡和牛,总共有40个头和120条腿,你可能需要写下简单的方程才能得出答案(20只鸡和20头牛)。

在AI领域,大语言模型的思维链推理意味着将问题分解为更小的中间步骤,以提高最终结果的质量。虽然得出答案通常需要更长时间,但答案更可能正确,尤其是在逻辑或编码场景中。推理模型是在传统大语言模型基础上发展而来,并通过强化学习针对思维链思考进行了优化。

(参见:大语言模型

编码智能体

这是比“AI智能体”更具体的一个概念,AI智能体指的是能够自主、逐步采取行动以完成目标的程序。编码智能体是应用于软件开发的专用版本。它不仅仅是建议代码供人类审查和粘贴,而是能够自主编写、测试和调试代码,处理那些通常占据开发人员一整天的迭代、试错工作。这些智能体可以在整个代码库中运行,发现错误、运行测试并推送修复,只需极少量的人工监督。可以把它想象成聘请了一位速度极快、从不睡觉、从不分心的实习生——不过,和任何实习生一样,仍然需要人类来检查其工作成果。

计算力

虽然“计算”是一个多义词,但通常指的是让AI模型运行的关键算力。这种处理能力驱动着AI行业,使其能够训练并部署强大的模型。该术语常被用作提供算力的硬件(如GPU、CPU、TPU及其他构成现代AI行业基石的基础设施)的简称。

深度学习

深度学习是自我改进型机器学习的一个子集,其AI算法采用多层人工神经网络(ANN)结构。与线性模型或决策树等更简单的机器学习系统相比,深度学习算法能够建立更复杂的关联。深度学习算法的结构借鉴了人脑中神经元相互连接的路径。

深度学习AI模型能够自行识别数据中的重要特征,无需人类工程师定义这些特征。这种结构还支持算法从错误中学习,并通过重复和调整的过程改进自身输出。然而,深度学习系统需要大量数据点(数百万甚至更多)才能产生良好结果。与更简单的机器学习算法相比,其训练时间通常也更长——因此开发成本往往更高。

(参见:神经网络

扩散

扩散是许多艺术、音乐和文本生成AI模型的核心技术。受物理学启发,扩散系统通过添加噪声缓慢“破坏”数据结构(例如照片、歌曲等),直至数据荡然无存。在物理学中,扩散是自发且不可逆的——咖啡中扩散的糖无法恢复为块状。但AI中的扩散系统旨在学习一种“反向扩散”过程来恢复被破坏的数据,从而获得从噪声中恢复数据的能力。

蒸馏

蒸馏是一种通过“教师-学生”模型从大型AI模型中提取知识的技术。开发者向教师模型发送请求并记录输出。有时会将答案与数据集进行比较以评估准确度。随后,这些输出用于训练学生模型,使其学会近似教师模型的行为。

蒸馏技术可用于基于较大模型创建更小、更高效的模型,且蒸馏损失极小。这很可能是OpenAI开发GPT-4 Turbo(GPT-4的更快版本)的方式。

虽然所有AI公司都在内部使用蒸馏技术,但部分AI公司也可能利用它来追赶前沿模型。从竞争对手处进行蒸馏通常违反了AI API和聊天助手的服务条款。

微调

微调是指对AI模型进行进一步训练,以针对比其先前训练重点更具体的任务或领域优化性能——通常通过输入新的、专门化(即面向任务)的数据来实现。

许多AI初创公司以大型语言模型为起点构建商业产品,但正试图通过基于自身领域知识和专业经验的微调来补充早期训练周期,从而提升在目标领域或任务中的实用性。

(参见:大型语言模型 [LLM]

GAN

GAN,即生成对抗网络,是一种机器学习框架,支撑了生成式AI在生成逼真数据方面的一些重要进展——包括(但不限于)深度伪造工具。GAN使用一对神经网络,其中一个基于训练数据生成输出,传递给另一个模型进行评估。

这两个模型本质上被编程为试图超越对方。生成器试图使它的输出通过判别器的检测,而判别器则致力于识别人工生成的数据。这种结构化对抗可以优化AI输出,使其更加逼真,而无需额外的人工干预。尽管GAN更适合窄范围的应用(如生成逼真的照片或视频),而非通用型AI。

幻觉

“幻觉”是AI行业对于AI模型胡编乱造——即生成不准确信息——的偏好术语。显然,这是AI质量的一大问题。

幻觉产生的生成式AI输出可能具有误导性,甚至可能带来现实生活中的风险——产生潜在危险后果(想象一下健康查询返回有害的医疗建议)。

人工智能编造信息的问题被认为是由训练数据中的空白造成的。幻觉现象正推动AI模型向日益专业化和/或垂直化方向发展——即需要更窄专业知识的领域特定AI——以此降低知识空白的可能性,并减少虚假信息风险。

推理

推理是运行AI模型的过程。它让模型根据之前见过的数据进行预测或得出结论。需要明确的是,没有训练就无法进行推理;模型必须先学习数据中的模式,然后才能有效从训练数据中进行推断。

许多类型的硬件都能执行推理,从智能手机处理器到高性能GPU,再到定制设计的AI加速器。但并非所有硬件都能同样出色地运行模型。例如,在笔记本电脑上运行非常大的模型进行预测可能需要很长时间,而在配备高端AI芯片的云服务器上则快得多。

[参见:训练]

大语言模型 (LLM)

大语言模型(LLM)是流行AI助手所使用的AI模型,例如ChatGPTClaude谷歌的GeminiMeta的AI Llama微软CopilotMistral的Le Chat。当你与AI助手聊天时,你实际上是在与一个大语言模型交互,该模型直接处理你的请求,或者借助网页浏览、代码解释器等各种可用工具来处理。

LLM是由数十亿个数值参数(或称权重,见下文)构成的深度神经网络,它们学习单词和短语之间的关系,并创建语言的表征——一种单词的多维映射图。

这些模型是通过编码它们在数十亿本书籍、文章和转录文本中发现的模式而创建的。当你向LLM发出提示时,模型会生成与提示最匹配的模式。

(参见:神经网络

内存缓存

内存缓存是指一种能加速推理(即人工智能生成用户查询响应的过程)的重要机制。本质上,缓存是一种旨在提升推理效率的优化技术。人工智能显然依赖于高强度的数学计算,而每次计算都会消耗更多电力。缓存通过为未来的用户查询和操作保存特定计算结果,来减少模型可能需要的计算次数。内存缓存有多种类型,其中较为知名的一种是KV(键值)缓存。KV缓存适用于基于Transformer的模型,它通过减少生成用户问题答案所需的时间(和算法工作量)来提高效率,从而更快地得出结果。

(参见:推理

模型上下文协议(MCP)

模型上下文协议(Model Context Protocol,简称MCP)是一种开放标准,它允许AI模型连接到外部工具和数据——比如你的文件、数据库,或Slack、Google Drive等应用——而无需开发者为每一对组合构建自定义连接器。你可以把它想象成AI的USB-C接口。Anthropic于2024年推出了MCP,随后将其移交给了Linux基金会,此后OpenAI、Google和Microsoft也采用了这一标准,使之成为近年来AI领域普及最快的标准之一。

混合专家模型(MoE)

混合专家模型是一种架构,它将神经网络拆分成许多更小的专用子网络(即“专家”),并且对于任何给定任务,只激活其中少数几个专家。MoE模型并非将每个请求都路由到整个模型——好比每个问题都叫上整个办公室的人——而是内置了一个“路由器”,只为任务挑选合适的专家。这使得构建巨大模型成为可能,同时保持相对快速和低成本的运行,因为任何时候只有一小部分网络在工作。Mistral AI的Mixtral模型就是一个著名的例子;OpenAI较新的GPT模型也被广泛认为采用了类似方法,尽管该公司从未正式确认。

(参见:神经网络深度学习

神经网络

神经网络是指支撑深度学习的多层算法结构——更广泛地说,是指大型语言模型出现后生成式AI工具整体繁荣的基石。 

尽管从人类大脑密集互联的通路中汲取灵感,将其作为数据处理算法的设计结构这一想法可以追溯至20世纪40年代,但真正释放这一理论力量的是近期通过电子游戏行业崛起的图形处理硬件(GPU)。这些芯片被证明非常适合训练比以往时代能够实现的层数更多的算法——使基于神经网络的AI系统在语音识别、自主导航和药物发现等多个领域实现远优于以往的性能。

(参见:大型语言模型 [LLM]

开源

开源指的是软件——或越来越常见的AI模型——其底层代码公开,任何人都可以使用、检查或修改。在AI领域,Meta的Llama系列模型是一个突出的例子;Linux则是操作系统领域著名的历史对照。开源方法使世界各地的研究人员、开发者和公司能够在前人工作的基础上继续构建,加速进步,并能够进行封闭系统难以提供的独立安全审计。闭源意味着代码是私有的——你可以使用产品但不能看到其工作原理,例如OpenAI的GPT模型——这一区别已成为AI行业中最具决定性的辩论之一。

并行化

并行化意味着同时做多件事,而不是一件接一件地做——就像让10名员工同时处理项目的不同部分,而不是一名员工依次完成所有工作。在AI中,并行化对于训练和推理都至关重要:现代GPU专门设计用于并行执行数千次计算,这是它们成为行业硬件支柱的重要原因。随着AI系统变得越来越复杂、模型越来越大,跨多个芯片和机器的并行化能力已成为决定模型构建和部署速度及成本效益的最重要因素之一。研究更好的并行化策略现在已发展成为一个独立的研究领域。

RAMageddon

“内存大灾”(RAMageddon)是一个有趣的新术语,描述的却是席卷科技行业的一个并不有趣的趋势:随机存取存储器(RAM)芯片日益短缺,而我们日常使用的几乎所有科技产品都依赖这种芯片供电运行。随着人工智能产业的蓬勃发展,各大科技巨头和AI实验室——都在争相开发最强大、最高效的AI——为了支撑其数据中心,大量购买RAM芯片,以至于留给其他领域的份额所剩无几。这种供应瓶颈意味着,剩余的芯片价格越来越昂贵。

这波及了多个行业,例如游戏业(大公司不得不提高游戏机售价,因为为其设备采购内存芯片变得困难)、消费电子业(内存短缺可能导致智能手机出货量出现十多年来最大降幅),以及通用企业计算领域(因为这些公司无法为自己的数据中心获取足够的RAM)。价格飙升预计只会在这种可怕的短缺结束后才会停止,但不幸的是,几乎没有迹象表明这种情况会很快结束。

递归自我改进

与通用人工智能(AGI)一样,递归自我改进是衡量AI智能程度以及对人类依赖程度的一个门槛。在RSI的场景中,AI模型无需人工干预即可开始自我改进,从而导致其能力和自主性大幅提升。在某些说法中,这将是堪比奇点(singularity)的灾难性时刻,即AI模型变得不受外部干预影响的时刻。但RSI也描述了一种基本能力——AI模型能否设计出自己的继任者?——这使得工程师更容易尝试构建它。近期多家AI初创公司已着手构建递归自我改进模型,但大多数都否定了其末日般的含义,将RSI视为下一个研究前沿。

强化学习

强化学习是一种训练人工智能的方式,系统通过尝试行为并根据正确答案获得奖励来学习——就像用零食训练你心爱的宠物一样,只不过这里的“宠物”是神经网络,“零食”是表示成功的一种数学信号。与监督学习(模型在固定标注数据集上训练)不同,强化学习让模型探索环境、执行动作,并根据收到的反馈不断更新自身行为。这种方法在训练AI玩游戏、控制机器人,以及最近在提升大语言模型推理能力方面,已被证明尤为强大。像基于人类反馈的强化学习(RLHF)这样的技术,现在已成为顶尖AI实验室微调模型、使其更实用、准确和安全的核心手段。

Token(词元)

在人机通信方面,存在一些明显的挑战——人类使用自然语言交流,而AI程序通过基于数据的复杂算法过程执行任务。词元(Token)弥合了这一鸿沟:它们是人与AI通信的基本构建块,代表由大语言模型处理或生成的离散数据片段。词元通过称为“分词”(tokenization)的过程创建,该过程将原始文本分解成语言模型能够消化的小单元,类似于编译器将人类语言翻译成计算机能理解的二进制代码。在企业环境中,词元也决定了成本——大多数AI公司按词元计费,也就是说,企业使用越多,支付越多。

Token吞吐量

重申一下,词元(Token)是AI语言模型在处理语言之前,将语言分解成的小文本块——通常是单词的一部分而非整个单词;在理解AI工作负载时,它们大致相当于“单词”。吞吐量指的是在给定时间内能处理多少数据,因此词元吞吐量本质上是衡量一个系统同时能处理多少AI工作量的指标。高词元吞吐量是AI基础设施团队的关键目标,因为它决定了模型同时服务的用户数量以及每个用户收到响应的速度。AI研究员Andrej Karpathy曾描述说,当自己的AI订阅闲置时,他会感到焦虑——这种感觉与他作为研究生时昂贵的硬件设备未被充分利用时的心情相呼应——这种情绪也解释了为什么最大化词元吞吐量已成为该领域的一种执着追求。

训练

开发机器学习人工智能涉及一个称为训练的过程。简单来说,就是将数据输入模型,使其能够从模式中学习并生成有用的输出。本质上,这是系统对数据特征做出响应的过程,从而使其输出能够适应所追求的目标——无论是识别猫的图片还是按需生成俳句。

训练可能成本高昂,因为它需要大量输入数据,而且所需数据量一直呈上升趋势——这就是为什么混合方法(例如使用目标数据微调基于规则的AI)能够在不从头开始的情况下帮助控制成本。

[参见:推理]

迁移学习

这是一种技术,将先前训练好的AI模型作为起点,开发用于不同但通常相关任务的新模型——从而能够重新应用先前训练周期中获得的知识。

迁移学习可以通过缩短模型开发过程来提高效率并节省资源。当为模型开发的任务数据有限时,它也很有用。但重要的是要注意这种方法有其局限性。依赖迁移学习来获得通用能力的模型,很可能需要额外数据的训练才能在重点领域表现良好。

(参见:微调)

验证损失

验证损失是一个数字,告诉你AI模型在训练期间的学习效果如何——数值越低越好。研究人员将其作为实时成绩单密切跟踪,用它来决定何时停止训练、何时调整超参数,或者是否调查潜在问题。它帮助标记的一个关键问题是过拟合,即模型记住了训练数据,而不是真正学习可以泛化到新情况的模式。可以将其理解为真正理解材料的学生与只记住去年考试的学生之间的区别——验证损失有助于揭示你的模型正在变成哪一种。

权重

权重是AI训练的核心,因为它们决定了系统训练所用数据中不同特征(或输入变量)的重要程度(即权重)——从而塑造AI模型的输出。

换句话说,权重是定义数据集中对于给定训练任务最显著的数值参数。它们通过对输入进行乘法运算来实现其功能。模型训练通常从随机分配的权重开始,但随着过程的进行,权重会调整,因为模型试图获得更接近目标的输出。

例如,一个基于目标地区历史房地产数据训练、用于预测房价的AI模型,可能会包含卧室和浴室数量、房屋是独立式还是半独立式、是否有停车位、车库等特征的权重。

最终,模型赋予每个输入的权重反映了它们根据给定数据集对房产价值的影响程度。

本文会定期更新最新信息。

原文链接纠错/举报