EP.014 / TRANSCRIPT

感知机:Frank Rosenblatt 与会犯错的机器逐字稿

从可调整的评分单到语言模型预训练

FINAL MASTER / release-approved

第一章:研究人的人,为什么造机器

0:00

Frank Rosenblatt 读心理学博士时,做过一台处理人格数据的计算设备。数据来自他的博士研究。一个研究人的人,已经开始自己动手造机器。

康奈尔大学后来的回顾,记下了他这段研究经历:心理学给了他要处理的数据,计算设备成了研究工具。造出这样的设备,已经需要把人的问题转成机器能处理的形式。

而当他转向学习机器时,问题又进了一步。能不能把学习本身也做成一种可观察的过程,让机器经历一些练习,再看它怎样改变判断?

[001]

引用 [001]

context

博士设备来自后见机构文章,1958 原文支撑学习模型的研究对象。末句是两份材料的编辑连接,不证明人格数据研究直接导致感知机,也不恢复私人触发事件。

定位 Cornell: Techies, nut cases and nerds, paragraphs beginning Born in 1928 and This research led him to computing; 1958 pp. 386-388

查看完整证据关系

一九五八年,在康奈尔航空实验室工作的 Rosenblatt,发表了一篇关于感知机的论文。开头的问题带着鲜明的心理学意味:外面的信息怎样被感知?感知过的东西,以什么形式被记住?记住以后,又怎样影响之后的识别和行为?

我们可以把后两个问题放进一个很普通的动作里。一个人刚开始认某种图案,经常认错。看过一些例子,练习一段时间,再遇到它,判断就变了。留在眼前的还是那个图案,经验究竟留在了哪里?

Rosenblatt 尤其想研究的,就是中间这段看不见的变化。只告诉他“这个人现在能认出来了”,还没有回答经验怎样起作用。

[002]

引用 [002]

context

支撑机构、发表年份和作者明确的科学问题;认图案的日常动作是节目解释,不是具体受试者记录,也不把当年的生理学判断当作当前定论。

定位 1958 p. 386, author affiliation, opening three questions and stated focus on questions 2 and 3

查看完整证据关系

假如设计者事先把各种图案的处理办法都安排好,机器也可以作出正确响应。但在 Rosenblatt 看来,安排出一个结果,还不足以说明大脑怎样学会这个结果。他希望模型能容纳另一种过程:系统经历了什么,会改变内部的连接;改变过的连接,再影响后面的响应。

这条思路有前人。论文讨论了通过连接变化解释学习的已有研究,他要把其中一些想法发展成可以分析的模型。这样,研究者才有机会追问:哪些条件足够,哪些条件还不够,换一种组织方式,结果会怎样。

“经验”这个很宽的词,开始有了一个可以检查的落点。把同一个输入交给系统两次,在中间加入训练,看它内部什么变了,回答又有没有跟着变。

[003]

引用 [003]

context

支撑作者的建模取向及前驱关系;两次输入是教学设想,不是发布会或具体实测。不能推出此前无人研究学习或模型已经解释真实大脑。

定位 1958 pp. 386-388, connectionist position, comparison with designed logical networks, discussion of Hebb and Hayek

查看完整证据关系

第二章:让机器改口

2:08

为了听清这次变化,我们自己做一套分拣卡片的例子。它不复刻当年的演示。想象卡片要被分到左右两边,机器能得到一些线索,比如颜色和形状。每条线索旁边,都有一个可调整的分数。机器把当前用到的分数合起来,跟一个规定好的门槛比较,再决定卡片该往哪边走。

第一次,它把一张本该去右边的卡片判到了左边。训练过程收到正确类别,按照预先规定的办法,调整这次判断中有关线索的分数。然后,同一张卡片再次进入机器。

卡片没换,线索没换,某些分数已经变了。合起来的结果如果跨过门槛,机器就会改口。

[004]

引用 [004]

context

自拟单输出教学模型说明一次纠错动作,固定门槛以控制解释范围。颜色 / 形状是已提供特征,不是 1958 感觉层或 Mark I 输入的原样复刻;不代表所有历史强化系统。

定位 1961 §5.5 pp. 109-111, elementary perceptron error correction; Pater §2.1 pp. 4-6, feature weights and threshold examples

查看完整证据关系

这些分数,就是理解“权重”的一个入口:某条线索在判断里起多大作用,由一个数值表示。权重没有自己的信念。它不会觉得哪张卡片更可爱,也不会因为受了批评就下决心认真一点。发生的是数值调整。

评分单的比喻只取这一点。真实模型中的线索怎样形成、连接怎样组织,还有自己的结构。我们把它暂时画成一张纸,是为了看清训练到底留下了什么:它留下的改变,会参与下一次计算。

这和给每张卡片另写一条处理规则,已经有了差别。设计者规定了什么可以改、怎样改,但最终那些数值是多少,也要由训练例子来塑造。

[005]

引用 [005]

context

支撑连接数值、组织和纠错关系;纸面评分单与手写规则为方法对照,不能说设计者退出或历史模型只有原始输入与一个输出。

定位 1958 pp. 389-391 / Fig. 1, sensory, association and response organization; 1961 §5.5 pp. 109-111

查看完整证据关系

麻烦也从这里出现。假如这次调整,提高了某种颜色的分量,下一张带着同样颜色的卡片,也会受影响。它可能因此更容易被分对,也可能原本分对,现在又被分错。

所以,“这张终于对了”只能算一个局部结果。训练还得让其他例子再次出现,检查这次改变有没有把别处弄坏。机器并没有给每道题各留一份互不相干的答案。几个例子共用判断中的数值,就会彼此牵动。

对 Rosenblatt 的研究来说,这种牵动很关键。经验若只是被单独存起来,下次照着抄,我们看到的是记住了一个答案。现在,训练对系统造成的改变,还可能扩散到别的输入上。扩散得有没有用,要靠实验回答。

[006]

引用 [006]

context

支撑多个刺激共享参数和反复训练的动作;卡片影响是条件性教学推演,不断言每次更新都会改善泛化,也不声称排除了记忆训练数据。

定位 1961 §5.5 pp. 110-111, stimulus recurrence and shared adjustable values; Pater §2.1 pp. 4-7

查看完整证据关系

要把这种变化做成可以反复测试的装置,论文还需要工程同事接手。在一九六一年的报告里,Rosenblatt 把 Mark I 感知机的主要工程工作,归给 Charles Wightman 和 Francis Martin;把这台机器的实验工作,归给 John Hay。

Mark I 是研究中的实体机器。负责工程的人,要让模型要求的连接和调整在硬件里发生;负责实验的人,要检验这套装置实际怎样表现。能在纸上描述“下一次应该不同”,与真有一台可以拿来重试的机器,中间隔着这些工作。

模型提出了一种学习的可能,工程使它可以被操作,实验再把它的表现交回来。有时候交回来的是成功,有时候是怎么练都处理不好的例子。

[007]

引用 [007]

context

分工来自作者致谢;后两段解释理论、工程、实验的关系,不补写个人操作日志、实验卡片、建成年或某次失败现场。Mark I 不与 1958 IBM 704 模拟混写。

定位 1961 preface printed p. ix, Wightman / Martin engineering and John Hay experimental program; §5.5 p. 111 and §27.3 p. 582

查看完整证据关系

第三章:再练一遍,也未必能解决

5:08

同样是分错,原因可能完全不同。继续用那张评分单:如果表格上只记了颜色,却要求机器按形状分拣,会发生什么?两张颜色相同、形状不同的卡片,送到判断环节时,看起来一模一样。

把颜色的分数调高,或者调低,都不能凭空补出形状。练习次数增加了,漏掉的线索仍然漏着。这时候应该回去改的是提供给机器的信息。

这个例子容易理解,却还不是全部困难。把线索补齐以后,怎样组合它们,也可能有问题。

[008]

引用 [008]

context

缺失形状是节目自拟的信息限制例子,不是原论文实验,更不能代替后段对固定表示和加权组合能力的限制。

定位 Pater §2.1 pp. 4-6, classification relative to specified input features

查看完整证据关系

想象分拣要求取决于两条线索的搭配。同一条线索,在一种搭配里应该帮助卡片去右边,换一种搭配,却应该产生相反的作用。若它在表上始终只能贡献同一个分数,整套判断就可能顾得了这一边,顾不了另一边。

问题出在允许它使用的办法。线索已经摆在面前,机器仍可能没有合适的内部组织,把这些线索按任务需要组合起来。只反复调同一组分数,未必能造出缺少的那种判断。

所以,看到一台学习机器反复失败,不能只问它是不是练得还不够。还要问:我们给它的这套结构,容不容得下那个答案?

[009]

引用 [009]

context

仅口述固定特征、加权求和与门槛组合可能不足的直觉,不作为完整数学证明,不概括所有感知机或所有神经网络。XOR 四格表留在研究资料包。

定位 Pater §2.1 pp. 4-6, XOR and single-layer versus multi-layer representation

查看完整证据关系

Rosenblatt 报告中的纠错保证,也把前提放在这里。对它讨论的那种模型,如果当前分类确实存在一组能完成任务的数值,而且训练中的各个输入会不断重新出现,那么按规定纠错,可以在有限时间内找到解。

这已经是一项很有分量的保证。研究者不必每次都凭运气试出一组数值。但“有解”是保证成立的前提,不能被悄悄删掉。如果结构里根本没有这样的解,再多训练也不属于这个保证的范围。

还有一道检查留在训练之外:把练过的例子全分对以后,换一批没见过的输入,表现会怎样?同一张卡片终于得到正确答案,和机器能应付新的情境,仍然要分别检验。

[010]

引用 [010]

context

定理限于 elementary alpha-perceptron、解存在、每个刺激有限时间内重现与指定纠错程序。正文省略符号但保留关键条件;定理不保证未见输入表现。证明为多人修订,不归为单人一次完成。

定位 1961 §5.5 Theorem 4 printed p. 111 and preceding definitions p. 110; Pater §2.1 p. 6

查看完整证据关系

训练让机器承担了一部分调整,研究者却没有因此离开。输入缺东西,要重新安排输入;组合办法不够,要重新考虑内部结构;训练成绩很好,也还得设计新的测试。

最初看起来,任务是让机器学会改口。走到这些限制面前,研究者自己的方案也需要改变。而怎样看待这种失败,又取决于 Rosenblatt 究竟想从机器身上得到什么。

[011]

引用 [011]

context

由前文条件与报告对可变组织的研究归纳设计责任,不虚构一次失败直接触发某章研究,也不把训练成功等同脑机制解释。

定位 1961 §5.5 p. 111, ch. 13 pp. 287-302 and preface pp. vii-viii

查看完整证据关系

第四章:分对了,然后呢

7:40

如果你需要的是一台分类装置,最直接的问题当然是:它分得准不准,能不能派上用场。但 Rosenblatt 在一九六一年的序言里,给自己的工作定了另一个重心。他首先想用感知机研究脑机制,弄清一些心理能力在什么物理条件下可能出现。

于是,同样一次训练,在两种工作里会引出不同的追问。使用装置的人看到错误减少,可能已经得到了需要的改进。研究学习机制的人还要问:什么变化带来了改进?拿掉某种连接会怎样?这个解释离真实大脑还有多远?

两种追问可以相互帮助。Rosenblatt 也欢迎别人把研究原则用到模式识别上。只是,机器完成一种识别,并不会自动证明,人脑用的就是同一套办法。

[012]

引用 [012]

context

研究定位是作者当年自述;两类使用者和拿掉连接的问法为编辑解释,不补写具体实验,也不把研究与工程应用写成互斥。

定位 1961 preface pp. vii-viii, natural intelligence, analyzable brain model and permitted engineering applications

查看完整证据关系

他也没有停在我们刚才那张简化的评分单上。这份报告已经讨论,让前端连接也能变化,以及怎样把网络组织成多层。先由一部分内部单元处理输入,再把处理过的结果交给后面的单元,能够给判断增加不同的可能。

可是,可以改变的地方一多,训练就更难安排。最后的回答错了,是前面组织线索的方式出了问题,还是后面使用这些线索的分量不合适?错误到了输出端,哪些内部连接应该承担多少调整,不能只靠一句“告诉它错了”就解决。

前面那项针对指定模型的纠错保证,也不会自动覆盖所有新设计。更多变化空间,要配上能训练这些变化的办法。

[013]

引用 [013]

context

支撑早期已有可变前端与多层研究及训练困难;不把全部方案说成已实现,不把报告中的 Back-Propagating 题名等同现代反向传播算法。

定位 1961 ch. 13 pp. 287-302, variable S-A connections; Part III chs. 15-20; Pater §2.1 pp. 6-7

查看完整证据关系

这些变化还得有地方发生。Mark I 用电机驱动的电位器来实现数值调节,连接则要依靠大型接线板。你可以把电位器理解成能够调节电阻的部件:在这里,调节可以由电机带动。纸面上改一个数,实物中需要相应的器件和连接来承载。

Rosenblatt 在报告后面直接指出,这两种办法都不适合非常大的系统。前面 Wightman 和 Martin 负责的工程工作,在这里显出了分量。做出一台能试验的装置,并不意味着把相同办法不断复制,就能得到任意大的学习系统。

问题同时落在两处:训练要知道怎样调整更多连接,工程要找到负担得起这些连接的做法。任何一边没有跟上,写在模型里的可能,都还不能成为实际能力。

[014]

引用 [014]

context

支撑硬件方式与作者明确的扩展限制;电位器说明为基本器件释义,不添加操作速度、成本数字、现场声音,也不把纸面权重与器件严格一一映射。

定位 1961 §27.3 printed pp. 581-583, especially p. 582 motor-driven potentiometers, patch-panel and cheap integrator / wiring constraints; preface p. ix

查看完整证据关系

Rosenblatt 对自己的理论也留下了修订空间。序言承认,早期报告在数学严谨性上有欠缺。他说模型经过了简化,并不完整;它的用途,在于至少可以被分析。

这让“会犯错的机器”多了一层含义。机器的错误可以进入训练,模型解释不了的地方,也可以进入研究。成功的实验提供证据,失败的实验限定解释,研究计划要容得下两种结果。

到这里,感知机给出了让经验影响判断的一种具体做法,也把训练和实现的难题暴露出来。更远的一步,是让学到的东西在不同输入之间更好地通用。语言会把这个要求推得尤其尖锐:人说出的句子,几乎总能换一种组合。

[015]

引用 [015]

context

前两段由作者自我限定形成编辑理解;末段交出跨输入复用的问题,下一章才建立具体语言模型事实。不宣称 1961 已证明后来的语言路线或直接促成 Bengio 工作。

定位 1961 preface pp. vii-viii, mathematical rigor, simplifications and analyzable model; §27.3 pp. 582-583

查看完整证据关系

第五章:词语之间,能不能借用经验

10:51

学过的组合有限,可能遇到的组合却多得多。把这个困难放到语言里,蒙特利尔大学的机器学习研究者 Yoshua Bengio 和三位合作者,在二〇〇三年给出了一个具体方案。从 Rosenblatt 的报告到这篇论文,已经过去四十多年,中间经历了许多研究变化。这里比较的是学习能做到什么,不是一条未经核实的直接师承。

语言模型要根据前面的词,估计后面的词有多大可能出现。可一个句子只要换掉几个词,就可能成为训练材料里从未出现过的组合。材料再多,也很难把所有说法都列完。

假如见过的每种说法都只能单独使用,模型就会不断遇到陌生组合。问题是,一句话里的练习,能不能帮助它处理另一句相近的话?

[016]

引用 [016]

context

作者为 Bengio、Ducharme、Vincent、Jauvin;支撑组合稀疏和共同学习方案。时间跨度只定位,不能推出 Rosenblatt 的直接启发、独占影响或表示学习首次发明。

定位 JMLR 3 pp. 1137-1139, author affiliations, Abstract, Introduction and §1.1

查看完整证据关系

我们自己换成两句中文。一句是,“他把杯子放在桌上。”另一句是,“她把碗放在桌上。”事情不同,人不同,东西也不同,但这两种说法有可以互相帮助的地方。

见过杯子怎样出现在这样的句子里,能不能让模型在遇到碗时,也利用一点相近的用法?如果机器拿到的只是互不相关的词语编号,编号本身不会告诉它这种关系。杯子排在第几号,碗排在第几号,与它们怎样用,没有必然联系。

Bengio 团队的方案,是给词语一组可以学习的数值。模型用这些数值参与预测,而训练也会改变这些数值。这样,词与词之间就有机会形成对预测有用的关系。

[017]

引用 [017]

context

杯子 / 碗两句为自拟中文类比,不是论文样本或同义句判定;词编号不能自行表达相似性,不等于所有离散语言模型都无法泛化。

定位 pp. 1138-1139, discrete-space generalization and §1.1 distributed word feature vectors

查看完整证据关系

可以想象一张词语地图。每个词有一个位置,某些用法相近的词,位置也可能接近。模型处理一个句子时,就不只是在查几个孤立的编号,还能利用这些位置之间的关系。

这张地图并不是研究者先画好,再永远贴在机器里。训练一边调整预测的方法,一边调整词的位置。如果某种调整能帮助模型更好地预测文本,它就可能被保留下来。词的这种数值形式,叫作“表示”。在这里,表示本身也参与学习。

地图只是帮助我们想象。实际用的是许多数值组成的空间,不是一张二维纸面;其中每个方向,也未必有“餐具”“人物”这样的现成名称。杯子和碗接近,不等于模型拥有了端杯子、拿碗的人类经验。

[018]

引用 [018]

context

词语地图解释可学习表示与共同优化;相近为可能形成的任务相关关系,不保证任意指定词对接近。类比不证明语义轴有人工标签或系统具有人的理解。

定位 pp. 1139-1141, §1.1 items 1-3 and §2 joint learning of feature vectors and probability-model parameters

查看完整证据关系

有了这样的表示,训练中一个句子造成的改变,就有机会帮助模型处理另一些组合。它仍然需要测试,仍然可能预测得不好,但“没见过这一整句”,不再等于这句话里的经验全都无从借用。

和前面那张固定线索的评分单相比,这个例子扩大了可以学习的范围:线索以什么形式交给后面的判断,也能随训练调整。早期多层研究已经提出过让内部更多部分改变的问题;二〇〇三年的论文让我们看到,在语言任务里,一种具体办法怎样把这种变化用起来。

训练因此积累了一些可供复用的东西。下一步可以追问:除了继续预测词语,这些学到的表示和数值,还能帮助模型做别的事吗?

[019]

引用 [019]

context

比较的是教学评分单与后来具体语言方法,不是宣称历史直到 2003 才有表示学习。技术相似和先后不证明作者之间的直接影响;其他任务的实例留到下一章。

定位 Bengio pp. 1137-1141, generalization and joint learning; 1961 ch. 13 and Part III

查看完整证据关系

第六章:先从文本练习

14:02

要让模型判断一段文字属于哪一类,或者判断两个句子之间的关系,通常得准备相应的例子和答案。文本本身很丰富,为一个个任务专门标注,却需要时间和劳动。

面对这道落差,二〇一八年,人工智能研究机构 OpenAI 的 Alec Radford 和三位合作者,尝试把训练分成两个阶段。先利用大量没有专门任务标签的文本,训练一个语言模型;再把学到的参数,作为完成具体任务的起点。

参数就是模型里那些由训练确定的数值。前面讲过的权重,也属于其中。先做一轮较通用的训练,再适应后面的任务,这里的第一阶段就叫“预训练”。这项工作后来被称为 GPT-1。

[020]

引用 [020]

supports

作者为 Radford、Narasimhan、Salimans、Sutskever;支撑未标注文本 / 任务标注落差和两阶段参数训练。GPT-1 为后来的称呼,不宣称该论文首次发明预训练或已做成现代聊天系统。

定位 PDF pp. 1-3, authors, Abstract, Introduction, §3 and §§3.1-3.2

查看完整证据关系

没有专人给每段文本标类别,练习的答案从哪里来?就从文本里来。让模型看到前面的内容,预测紧接着的一个文本单元,再拿原文实际出现的内容作训练目标。这个单元可能是一个词,也可能只是词的一部分。

比如刚才那句“他把杯子放在桌上”,我们可以停在“放在”后面,让模型根据已有内容作预测,再用原文后面的内容训练它。换到另一个位置,又有了新的前文和目标。一份已经写好的文本,可以提供许多这样的练习。

模型在训练中给不同后续内容分配不同的可能性。调整参数,要让实际出现的内容得到更合适的概率。这与前面那个按类别纠错的简单例子,用的不是同一套更新办法;但训练目标同样能影响内部数值,进而影响后面的回答。

[021]

引用 [021]

context

中文停句为自拟说明,不指定实际分词边界或复原训练样本。区分概率目标优化与历史类别纠错,不把出现次数或单次猜对解释成固定参数的充分条件。

定位 2018 §3.1 PDF p. 3 and §4.1 PDF p. 5, token objective and BPE vocabulary; 1961 §5.5 pp. 110-111

查看完整证据关系

原文提供的是练习目标,不是对世界的最终判决。文本里写了什么,和写的东西是否真实,是两回事。让模型更善于预测原文,也不等于已经教会它怎样核实所有陈述。

人的工作因此发生了变化。部分训练题可以从现成文本中构造,不必逐题手工写答案;但用哪些文本、让模型练什么、怎样判断它学得好不好,仍然需要选择。训练目标省下了一种劳动,也留下了决定学习方向的责任。

[022]

引用 [022]

context

从文本预测目标的定义与作者实际训练选择得出的编辑边界;不假借作者原话,也不借 2023 的已知表现解释 2018 人物当时的选择。

定位 PDF pp. 1-4, Introduction, §§3.1-3.2 and §4.1 training setup

查看完整证据关系

第二阶段,团队再用带标签的任务例子继续训练,让模型适应具体用途,比如文本分类和问答。关键在于,后面的任务可以从前面学到的参数出发,不必把那一轮文本练习全部作废、每项任务重新起步。

把两阶段连起来看,经验的用途又扩大了一次。它先在文本预测中改变模型,再成为别的语言任务可以继续使用的起点。这篇论文报告的任务评测,检验的就是这种迁移是否有帮助。

从有限分类到语言任务,后来研究者改变了模型,也改变了训练。面对这些新的用途,回头评价早期感知机,究竟应该看它当时完成了多少,还是看哪些方法后来仍然有用?

[023]

引用 [023]

context

支撑用预训练参数适应后续任务及论文评估对象;不说全部当前系统采用相同步骤,不把本论文当作作者对 Rosenblatt 的直接评价。

定位 PDF pp. 1-3, task evaluations in Abstract / Introduction and supervised fine-tuning §3.2

查看完整证据关系

第七章:后人记住了什么

17:00

在这一时期的回顾里,语言学研究者 Joe Pater 给出了一种提醒。他在二〇一八年梳理神经网络与生成语言学的发展,特别指出一件容易被略过的事:Rosenblatt 和他的团队,也做过多层网络研究。

这个提醒会改变我们怎样理解早期工作的局限。若只留下那张最简单的评分单,历史很容易变成一个过于整齐的故事:一个人造了简单机器,机器做不到复杂事情,研究于是结束了。实际研究的范围,比那张简图更广。让内部更丰富,并没有自动消除怎样训练的困难。

Pater 提醒我们保留的,正是两者之间的距离:一种结构可以表达更多东西,和研究者已经找到足够有效的训练办法,不能算作同一个成绩。

[024]

引用 [024]

context

具名转述 Pater 学术回顾;简化历史是节目解释其提醒的意义,不冒充具体人物原话,也不称 Pater 为专业科学史家。

定位 2018-10-03 manuscript §2.1 pp. 6-7, multi-layer representational capacity, training difficulty and Rosenblatt group research

查看完整证据关系

谈到这段历史,常会遇到另外两位研究者:Marvin Minsky 和 Seymour Papert。他们分析感知机的能力边界,合著的《感知机》在一九六九年出版,后来成为讲述这条路线时绕不开的一本书。

Pater 的回顾对此很谨慎。他说,很难判断研究转向,有多少来自书中的观察和论证,又有多少是神经网络研究本来就遇到了理论和技术阻力。这个判断没有给某个人分配一个方便记忆的责任份额。

对我们已经见过的机器,这种谨慎有具体内容。内部怎样训练,器件怎样扩展,原本就是研究中的问题。把它们全换成一本书的作用,会丢掉研究者当时真正要面对的困难。承认批评影响了讨论,与宣判它独自终结一条路线,之间还有很长一段证据距离。

[025]

引用 [025]

context

著作身份和历史分析均明确来自已读 Pater,未取得 1969 原书或 Olazaran 全文,不直接引用原书定理。末段为编辑判断,不裁定经费变化、私人动机或寒冬责任。

定位 Pater §2.1 pp. 6-7, 1969 book and historical-causation qualification; 1961 §27.3 p. 582

查看完整证据关系

另一种评价,关心的是这个人愿意研究多大的问题。康奈尔大学二〇一九年的纪念文章,转引了 Richard O'Brien 更早在 Rosenblatt 悼念仪式上的话。O'Brien 曾任该校生物科学部门负责人。

在他的回忆里,Rosenblatt 不愿只挑一个预计一两年就能解开的小问题。他想追问的是,大脑至少需要什么样的物理条件,才能做出那些惊人的事情。他把自己投入了这个未必很快得到答案的问题。

这段悼念让开头那个心理学家的行动,有了另一种观察尺度。O'Brien 记住的,既有他在做什么,也有他愿意把研究花在哪里。这样的敬重,当然不能替模型证明正确;它让我们听见的是,一位同事怎样理解他的选择。

[026]

引用 [026]

context

O'Brien 悼念评价由 2019 文章转引;本稿只作有归属的中文转述,不冒充 2019 新讲话、已核录音或完整心理传记。时间口径与悼念语境在正文可听见。

定位 Techies, nut cases and nerds: paragraph beginning He wanted to ask himself; Within human grasp: paragraph beginning He would never, as prudent professors do

查看完整证据关系

同一篇文章里,康奈尔的机器学习研究者 Thorsten Joachims,谈的则是方法留下了什么。他在教学中讲感知机,也从后来的深度网络训练回看这项工作。在他的评价里,感知机算法仍然是这些训练方法的重要基础。

他看重的是一种能够延续和改变的做法:让训练影响模型内部的数值,使机器的识别能力不完全取决于设计者事先写下的具体判断。早期装置能完成的任务有限,这种方法的后续用途却不必停在那里。

我们仍然需要保留“后来的训练方法”这几个字。它们经过许多人的改变,已经增加了不同的结构和训练过程。Joachims 对方法的肯定,并没有把 Mark I 变成一台缩小的现代深度网络。

[027]

引用 [027]

context

方法评价明确归于 Joachims,第二段为对其评价对象的编辑解释,机制差异由已引技术材料约束。不采用 Cornell 中全部 AI 起源、数百万层等表述,也不说受访者在回应 GPT-1。

定位 Cornell opening Joachims teaching identification and Minsky vs. Rosenblatt paragraph beginning What Rosenblatt wanted; 2018 §§3.1-3.2

查看完整证据关系

这几种评价放在一起,并不是一场隔空辩论。Pater 在提醒我们看清历史中的技术困难,O'Brien 在悼念一个选择了大问题的人,Joachims 在肯定后来仍有用的方法。

如果只问“Rosenblatt 究竟成功了,还是失败了”,就会把这些不同的事情挤进同一个答案。研究一个重要问题,可能留下有价值的方法,同时又没有完成原先希望获得的全部解释。

后来的模型越强,这个区分越需要保留。新能力可以增加我们对方法价值的认识,却不能把它自动折算成早期每一个设想都已经得到证明。

[028]

引用 [028]

context

这是节目比较评价尺度后的判断,不代表三人彼此争论、观点完全一致或学界共识;后来的工程表现不作为原始脑模型的全面验证。

定位 Pater §2.1 pp. 6-7; Cornell O'Brien / Joachims passages cited above; 1961 preface pp. vii-viii

查看完整证据关系

第八章:再把那个输入交给机器

20:53

后来的语言模型把训练带到了更大的系统里。二〇二三年,OpenAI 发表 GPT-4 技术报告,仍然把预测文档中的下一个文本单元,写作预训练的任务。报告也记载,模型随后经过了利用人类反馈的强化学习,让表现进一步适应期望的行为。

从文本里预测后文,与后面利用人的反馈,是不同阶段。它们共同提醒我们,最终听到的一段回答,背后有多种训练选择。单独一句“它在猜下一个词”,不足以交代整个系统怎样形成。

这份报告提供了一个具体的大模型实例。我们不需要把它当成所有模型的统一说明,也已经能看见:训练留下的影响,确实可以进入比早期分类装置广得多的语言用途。

[029]

引用 [029]

context

支撑 GPT-4 下一文本单元预训练与 RLHF 两个已披露阶段;不展开未披露规模或全部后训练步骤,不用该模型代称全部当前产品。

定位 PDF pp. 1-2, Abstract, Introduction and §2 Scope and Limitations

查看完整证据关系

但当我们在聊天窗口里说“你刚才答错了”,它马上换了一个答案,这就等于刚才那张评分单被重写了吗?单凭改口,不能这样判断。

对话里多了一条纠正,模型收到的上下文已经不同。它可以利用这些新内容生成另一种回答,而不必在这次对话中重新训练参数。训练留下的长期改变,与当前输入改变之后的不同输出,是两种情况。GPT-4 的报告也明确提醒,这个模型并不会从使用中的经验持续学习。

回到本期那个受控的设想:输入保持相同,中间确实执行训练,然后检查内部数值与响应。把条件说清,我们才知道自己观察到的“改变”究竟是哪一种。

[030]

引用 [030]

context

聊天纠正为机制对照而非实测;不对所有服务的数据保存、后续再训练或持久记忆作断言。上下文变化不等于即时参数更新,受控输入设想也不保证每次训练后回答一定变化。

定位 GPT-4 Introduction PDF pp. 1-2, does not learn from experience, and §2; GPT-1 §3.1 conditional model; 1961 §5.5 pp. 110-111

查看完整证据关系

Rosenblatt 最初想知道,经验怎样被保留,又怎样影响识别。感知机给了这个问题一种可以摆出来检查的形式。连接能够改变,改变能够影响响应,研究者于是能对一种学习的解释提出条件,也能让实验来检验它。

后来,词的表示可以一起学习,文本练习所得可以成为新任务的起点,越来越多的能力被组织进更大的模型。这些工作扩大了方法的用途,却还不能只凭工程成绩,就替一个关于真实大脑的解释盖章。

模型是否有用,能否应付没见过的问题,以及它在多大程度上解释了人的学习,每一项都需要自己的证据。把它们分开,反而更容易看清 Rosenblatt 留下了什么。

[031]

引用 [031]

context

回收前文的研究问题、模型条件和方法用途,属于节目综合判断;不声称直接单线传承,也不由工程成功推出生物学假说已证实。

定位 1958 pp. 386-388; 1961 preface pp. vii-viii and §5.5; Bengio pp. 1137-1141; GPT-1 §§3.1-3.2

查看完整证据关系

他从心理学走向机器,是想让经验怎样影响判断,不只停留在一种描述里。他和同事把问题做成了可分析、可操作的模型。模型有限,制造和训练它的工作却使一些原本宽泛的追问,能够接受更具体的检验。

再把开头那个输入交给机器。它可能回答得更好了,研究者也可能发现,必须先改变自己的设计。两种结果都让问题向前走了一点。

后人能够继承的,既有从训练中调整数值的方法,也有这项工作的要求:说一台机器学会了什么,就把变化发生在哪里、怎样发生,以及还做不到什么,一起拿出来看。

[032]

引用 [032]

context

编辑结论回收已建立的研究动机、团队与限制;最后一段是节目对可继承价值的判断,不伪托作者原话或宣称所有后人都实际遵循此要求。

定位 1958 pp. 386-388; 1961 preface pp. vii-ix, §5.5 p. 111, ch. 13 and §27.3 p. 582

查看完整证据关系

独立片尾一:单集识别与系列位置

23:54

你刚刚收听的是《原代码》第十四期,《感知机:Frank Rosenblatt 与会犯错的机器》。这是《大语言模型前史》系列的第四期,副标题是“从 Alan Turing、John von Neumann 到 GPT-1”。这一期,我们考察了让训练改变判断的路线。下一期,系列会转向另一种做法:把专家的知识明确写进程序。这是同时代的另一条探索,不是前一条路线失败后才出现的答案。