Apollo人工智能助力修复残缺古希腊文本
WIRED AI··作者 Joel Khalili
关键信息
Apollo会根据文本语境调整建议,例如识别荷马式希腊语或多利安方言,并提供多个统计上合理的候选答案,而不是把单一补全文本当作事实。由于这些输出基于概率且可能出错,学者仍须结合年代、语言和历史证据进行判断。
资讯摘要
奥地利科学院计划发布Apollo,这是一款与Mistral AI和Sail Reply共同开发的古希腊语大语言模型。该模型使用从手稿、莎草纸文献和铭文中收集的约6亿个历史希腊语词汇进行训练,学者可以通过聊天机器人免费使用。它的主要任务包括寻找与特定研究方向相关的莎草纸碎片,以及为残损文献中的缺口提出可能的词语或段落。传统的文本修复要求专家先在没有空格的古希腊语书写中判断词语边界,再确定文献年代、评估其社会政治背景,并查阅大量参考资料。
Apollo旨在吸收这些语言模式,并区分荷马式希腊语、多利安方言等不同语境,从而缩短繁琐的修复过程。学者提醒说,它不太可能突然发现大批失传名作,因为许多尚未修复的莎草纸只是私人书信、婚姻契约和行政文件,但这些日常材料仍能补充人们对古代生活的认识。为降低错误混入历史记录的风险,Apollo会提供多个候选释读供专家评估,而不会把概率最高的补全当作定论。开发团队表示,如果这一方法取得成功,还可将其扩展到拉丁语、埃及语等语言,以及其他拥有大型资料库的学术领域。

资讯正文
周三,奥地利科学院将发布“世界上首个先进的古希腊语大型语言模型”。该模型由奥地利科学院与法国人工智能实验室 Mistral、技术服务公司 Sail Reply 合作开发。这个名为 Apollo 的模型使用约 6 亿个历史希腊语词汇进行训练,这些词汇取自手稿、纸莎草文献和铭文。
学者可以通过聊天机器人界面免费使用该模型。其目标是帮助学者更快找出与各自细分研究领域相关的纸莎草残片,并发现有前景的新研究方向。当文献残破不全时,Apollo 可以用统计上最有可能出现的单词或段落补全缺失内容,从而有望揭示有关历史事件和社会实践的隐藏细节。
Sail Reply 合伙人 Dimitris Vlitas 告诉《WIRED》,以这种方式发掘知识,“在一年前还是不可想象的”。
在此之前,修复一张残破的纸莎草文献,需要经验丰富的学者首先辨认词语的分界——古希腊语书写中没有词间空格——然后准确判定文献年代,权衡适当的社会政治背景,并查阅参考资料,以选择合适的词语填补缺口。伦敦大学学院古典学与历史语言学教授 Stephen Colvin 表示:“世界上精通希腊历史到这种程度的人寥寥无几。”
但所有这些专业知识都已融入 Apollo。奥地利科学院历史学家兼纸莎草学家 Anna Dolganov 表示:“当它看到荷马作品时,就会用荷马式希腊语进行补全;当它看到一段以多利亚方言写成的铭文时,就会使用多利亚方言。”
那些深陷繁琐重建工作的学者预计,Apollo 将大幅加快研究进程,让他们能够专注于历史文献所蕴含的意义,而不是费力弄清文献究竟写了什么。
牛津大学古典语言与文学教授 Armand D'Angour 表示:“我认为这非常令人兴奋。如果有一台机器告诉我,‘这里有三个可能适合填入这个缺口的词’,那将大大加快研究进度。”牛津大学收藏着全球规模最大的古代纸莎草文献。
Apollo 不太可能改变人们对古代世界的整体认识;许多纸莎草文献至今尚未得到修复,恰恰是因为其内容十分日常——例如私人信件、婚姻契约和公务文件。Colvin 说:“如果你是普通人,可能会以为我们突然能发现几部索福克勒斯的新剧作,但这种情况不会发生。”不过,该模型或许能帮助人们发现更多有关古代生活的新细节,并为学界现有的推测提供证据。D’Angour 表示:“每当一项成果问世,它都会为我们关于古代世界的知识增添一个微小的组成部分。”
Vlitas 表示,如果 Apollo 取得成功,同样的技术可以很容易地应用于其他古代语言——比如拉丁语或埃及语——也可以用于任何其他有必要对大量资料进行提炼和索引的学术领域。AI 已在一些领域取得显著成果;OpenAI 最近表示,其 AI 模型解决了一道有 200 年历史的数学难题,而 Google DeepMind 则发布了一个庞大的数据集,描绘基因突变如何影响分子生物学;该数据集是借助 AI 整理而成的。
一个潜在的担忧是,依靠处理概率问题的语言模型来填补古代文献中的缺失内容,可能会让错误混入历史记录。但为避免这一问题,Apollo 在设计上会提供多个备选词语,供学者从中选择。Dolganov 表示:“关键在于,人的专业能力必须继续发挥作用。如果我们完全依赖 AI 对历史材料进行转录和解读,问题就会从那时开始出现。”
来源与参考