中文译本 · 原作 Daniel Bourdeau《Unsolved Historical Ciphers》 以 CC BY 4.0 发布,本页由 JIC 翻译,非原作者官方版本,译文如有出入以英文原页为准 · 查看英文原页 ↗
4 · 罐 · 97 · 400 | 806 845 61 407 850 900 740 = 带角的弓箭手
255 435 690 740 · 705 33 520 · 名字 + 词尾,从不被换行拆开

摩亨佐-达罗、哈拉帕及其他50处遗址 · 语素音节文字,没有公认的解读 · 约公元前2600–1900年 · 已尝试,未读出

印度河文字:Parpola 的解读与2,727项登记在案的检验

Parpola 的达罗毗荼语读法,以及随后2,727项在检验前登记的假设,在两套相互独立的语料上运行,并以线形文字B和乌尔第三王朝印章作为对照:一种读法必须符合的语法已经阐明,但没有确立任何符号的音值。

Daniel Bourdeau · 发布于 · 更新于

方法:未破解 · 程度:未获得文本

速览未破解 · 2,727项登记假设中有1,425项成立

文本
出发点是 Asko Parpola 的讲座“Study of the Indus Script”(ICES 东京2005年,见 harappa.com)。其背后的铭文约有4,500件印章、刻板和陶片,大多数不到五个符号。
藏地
两份独立制作的机器可读转录:一份是源自 Interactive Corpus of Indus Texts(ICIT;Wells 和 Fuls)的数据库,另一份是 Mahadevan 1977年的索引(M77)。这里将两者逐个符号对应起来。Parpola 本人的Corpus of Indus Seals and Inscriptions的一份数字化版本作为第三重核对。
文字
约400–600个符号,大多从右往左书写,没有分词符,没有双语对照,所记语言不明。
尝试经过
首先,把 Parpola 讲座中和他1994年读法表中的每一个计数都重新算了一遍,并为他的泰米尔语检验设定了随机基线。然后,在查看数据之前,写下并提交了247组假设,共2,727项。每一项都经过检验,无论成立与否都记录在案,主要结果还在留出样本上、并对照两种可以读懂的文字(线形文字B、乌尔第三王朝楔形文字)重新运行。
结果如何
一套详细的语法,但没有任何音值。名字以一个槽位结尾,其形式(740、520或某个结尾符)由名字的最后一个符号决定。书写者从不在换行处拆开一对紧密结合的符号,也从不把名字与其词尾拆开。数字与它们所计数的符号固定搭配。印章上的名字表现得像人名,与同样长度的线形文字B名字一样。Parpola 的星名读法每一个都只依据一两枚印章。
尚未解决
一切与语音有关的东西,以及语言本身。对照泰米尔纳德邦奖金所需要的条件(第12节),决定一项解读能否成立的那几个层级几乎为零。本项目自己早先的几条结论被后来的检验推翻而撤回;它们列在第14节。

01 语料与符号

Parpola 的论证都是计数:最常见的符号出现得多频繁,哪些符号一起出现,哪些从不一起出现。为了重新运行这些计数,本项目使用了两份彼此独立制作的转录。第一份是源自 Interactive Corpus of Indus Texts(Wells 和 Fuls)的数据库,随 indus-website 项目发布:2,543件器物,11,253个符号,附有 CISI 器物编号、遗址和野外记录的图案。同一数据库的一份更完整的导出(5,680条记录,附出土地点、地层、尺寸和材质)用于后来的大多数检验。就所核对的符号而言,它的符号总数与 Fuls 的Catalog of Indus Signs(2023)中刊印的数字十分接近。ICIT 的符号只有编号,所以这里用数据库自己的字体把每个符号画出来,再对照 Parpola 的描述加以辨认。第二份转录是 Mahadevan 1977年的索引(2,906件文本)。两份符号表通过对齐它们共有的文本联系起来:991行,96%的符号对应唯一的对应符号。第一套语料中缺少的1,664件 M77 文本,自始至终都用作独立的复现样本。

本页所讨论的符号及其 ICIT 编号
本页所谈到的符号,附 ICIT 编号和计数:罐740,鱼系列(220素鱼,235“带顶”,233,231,240),蟹798,无花果772–786,无花果 + 蟹合体777,眼睛,双曲线,壶700,数字,以及铜板符号806 845 61 407 850。图像:此处用 indus-website 字体绘制(ICIT 符号编号)。

02 讲座中的论断,逐一核对

摩亨佐-达罗条形印章 M-414 的印文
M-414,摩亨佐-达罗出土的一枚条形印章,印出的样子。从右往左读:一个不清楚的交叉符号,枝上带横杠的 U 形“无花果”,以及素“鱼”。这是 Parpola 的第二个“无花果 + 鱼”,即vaṭa-mīn“北极星”。图像:Corpus of Indus Seals and Inscriptions,第1卷(Joshi 和 Parpola 1987),p. 100,M-414 a。

03 1994年的读法与泰米尔语检验

Parpola 1994年的书最后附有一张24个读法的表,以及他所依据的99个带mīn“鱼、星”的泰米尔语复合词的清单。在两套语料中,以下这些符号对都是真实的、反复出现的单位:3 + 鱼、6 + 鱼、眼睛 + 眼睛、炉灶 + 圆环、圆环 + “空间”,以及“空间” + 鱼。鱼 + 鱼、7 + 鱼、无花果 + 鱼、无花果 + “空间”和蟹 + 素鱼则处于或低于随机水平。书中说鱼之前的数字“仅限于3、4、6和7”。语料中有1、2、3、4、6、7和12,从来没有5,尽管泰米尔语中有对应5的星名。

每个读法背后的检验,都是它所给出的复合词是不是一个真实的泰米尔语词。一条随机基线表明这种检验有多弱。预先确定98个图画概念。表示该图画的某个泰米尔语词,有15%的概率恰好是 Parpola 的某个泰米尔语星名的开头;如果允许这些读法所用的语音宽容度,概率是30%。

04 铜板:七个“符号 = 图像”等式

摩亨佐-达罗的铜板成套出现,每套由相同的副本组成。每块一面有铭文,另一面是动物或人物,而在某些套中,单个符号取代了图画,铭文相同。把 Parpola 对46套铜板的分类与转录相匹配,得出七个等式:

这些是这种文字所能提供的最可靠的意义。图画符号749、341和753只出现在铜板上,777另外还出现在一枚印章上:没有任何印章名字用到它们。许多印章文本开头的那个起首符,从不出现在铜板文本的开头(198件中0件)。铜板的表现与印章不同。在第9节的捕获–再捕获检验中,铜板文本构成一小组封闭的标签,像称号一样在全城重复出现,而印章文本则各不相同。铜板上的图画还按摩亨佐-达罗的城区聚集:只有文字的铜板在 DK-G 南区,动物系列在 VS-A 区,人物和合成形象在卫城土丘上。

最常见的铜板铭文及其计数和图像
最常见的铜板铭文,按书写原样(从右往左),附副本数、阅读顺序以及另一面的图画:野兔、弓箭手、大象、单独出现的无花果 + 蟹合体。图像:此处用 indus-website 字体根据源自 ICIT 的语料绘制。

05 哪种语言?以梵语和苏美尔语作对照

对梵语(Monier-Williams)和苏美尔语(ePSD2 词表)也做了同样的检验。一幅图画得出一个星名的概率,梵语为19%,苏美尔语为10%,泰米尔语为15%。“鱼 = 星”这个双关也不是达罗毗荼语独有:苏美尔语mul是“星”,也是一种鱼;梵语有ṛṣi(一种鱼;大熊座的七仙人)。不过,在2,895种语言中(CLICS4),“鱼”和“星”的日常用词只在三种语言中相同,没有一种在南亚,而古泰米尔语mīn就是其中之一。所以,每一个鱼形读法的第一步确实是达罗毗荼语所特有的,尽管建立在它之上的泰米尔语复合词检验并非如此。鱼之前的数字并不符合泰米尔语的星名:只有6 + 鱼(昴星团)出现得偏多,而5 + 鱼从未出现。

06 其余部分如何完成:检验前登记的假设

上述核对之后的所有工作,都是作为登记在案的预测来运行的。每一组的假设及其阈值都写进 targets/indus/PREDICTIONS.md 并在任何脚本查看数据之前提交到仓库。然后运行检验,记录结果成立还是失败,不改动阈值。以这种方式运行了247组,共2,727项假设:1,425项成立,1,302项失败。从第176组起,它们以循环方式运行,按一个固定的进展指标打分(targets/indus/PROGRESS.md)。凡是某项检验后来被证明提法不当,或某个脚本有 bug,记录中都会注明,并在原结果旁给出更正后的结果。

计数针对的是不同的文本。同一枚印章在许多封泥上压印,或者一批相同的铜板,都只计一次,因为重复的副本会夸大任何模式。主要结果都在未用于发现它们的样本上重新运行过:Mahadevan 的 M77 补充部分、较小的遗址、不含铜板的更完整语料,以及 Parpola 的 CISI 转录。两种可以读懂的文字作为对照:线形文字B(迈锡尼希腊语,取自 DAMOS 数据库)和乌尔第三王朝时期的印章铭文(苏美尔语,取自 ORACC 的22,402个印文)。

07 一种读法必须符合的语法

08 第二份转录,以及他人的论断

09 什么样的名字?

一段印章文本很短,位于一只动物下方,以一个语法槽位结尾。它是人名、称号或官职,还是神名?捕获–再捕获,即生态学家用两个相互重叠的样本来估计种群数量的方法,提供了一种不需要音值就能提出这个问题的途径。把摩亨佐-达罗印章上的名字和哈拉帕印章上的名字当作从同一个种群中捕获的两批。有多少名字同时出现在两批中,就能说明整个种群有多大。

10 地点与时间

11 就语序所能显示的而言,这种语言

没有音值,就只有语序和语法的形态能说明语言。有四个特征指向同一个方向:

这符合达罗毗荼语和印度-雅利安语,而不利于把中心语放在前面的苏美尔语和埃兰语。还有两点进一步缩小了范围。词尾把人与鱼形名字(Parpola 的星)区分开来,而蒙达语的语法不会这样做。而且,“鱼 = 星”这个词在南亚只见于达罗毗荼语。两者合起来偏向达罗毗荼语,但前提是鱼形名字确实是星名,而且这里没有任何东西能单凭语序把达罗毗荼语和印度-雅利安语区分开。各语系的预期依据的是标准类型学,并非针对每种语言逐一核对过的来源。

候选语言中的名字列表又带来了两个结果。乌尔第三王朝印章上的苏美尔人名固定的是第一个成分(Ur-、Lu-、Nin-、神名符号),而印度河名字固定的是最后一个成分,线形文字B和梵语名字也是如此。这再一次排除了苏美尔式的名字结构。在达罗毗荼语和印度-雅利安语之间,这些列表无法作出判断。印度河名字的长度更接近梵语名字。一种词尾占主导(740结束了82%的名字),则更接近古泰米尔语人名,其中67%以阳性后缀-aṉ结尾,Mahadevan 正是把740读作这个后缀。随后,一个更贴近的印度-雅利安语参照又让论证掉转了方向。Lüders 的早期婆罗米文铭文列表(1912)给出了桑吉和巴尔胡特的374个俗语(Prakrit)捐献者名字,约公元前200年至公元400年。这些是捐献器物上的人名,在时间、地点和体裁上都与印度河印章接近。印度河名字的构成与它们相似:

俗语捐献者名字也带有一个几乎普遍的词尾,即捐献套语中的属格-sa。所以,像740这样占主导的词尾,既符合泰米尔语的-aṉ,也同样符合印度-雅利安语捐献者式的套语。与之相应的达罗毗荼语检验,用的是捐献记录中的泰米尔语名字:取自 DHARMA 泰米尔语铭文英译本的1,396个名字,7世纪以后。它使证据分成两边:

因此,名字结构排除了苏美尔类型,但无法在印度-雅利安语和达罗毗荼语之间作出判断。此外,泰米尔语记录比俗语列表晚得多,其中许多名字源自梵语。

随后又根据 Mahadevan 的Early Tamil Epigraphy的页面扫描件,建立了一份同时代的达罗毗荼语列表:取自泰米尔-婆罗米文洞窟铭文的104个捐献者名字,约公元前2世纪至公元4世纪。它在时期和体裁上都与俗语列表相匹配。

按这些指标,印度河名字看起来更像早期印度-雅利安语的捐献者名字,而不是同时代的泰米尔语名字。后来的一项对照推翻了这一点。加入了类型学上相匹配的诱饵:日语和土耳其语的人名,这两种语言具有与印度河相同的语序特征。两份南亚捐献者列表都胜过了这两个诱饵,但它们是铭文,而诱饵是名字列表。当两边的体裁都匹配时(取自 Monier-Williams 的梵语名字和桑伽姆诗人的名字,对比同样的日语和土耳其语列表),日语最接近印度河名字,在数据的两半中都是如此。早先的偏向是体裁造成的,而不是语言。这类名字结构统计无法选出一种语言。

世界类型学能缩小范围,但也仅此而已。对照 WALS 和 Grambank 数据库检验印度河的语序特征,可以排除世界上81%的语言属(Grambank 语系的68%)。达罗毗荼语、印度-雅利安语、蒙达语、布鲁夏斯基语、突厥语、蒙古语、日语和朝鲜语全都还在。唯一的类别信号(以鱼为中心语的名字取520,而以人、工具和植物为中心语的名字取740),在摩亨佐-达罗、哈拉帕和其他遗址都成立,早期和晚期都一样。它既符合达罗毗荼语的“人/非人”区分,也同样符合梵语的性别解读,因为星名大多是阴性的。

12 对照奖金要求:一张评分表

2025年1月,泰米尔纳德邦政府悬赏一百万美元,奖励能“令考古专家满意地”解读这种文字的人。此后没有公布进一步的规则。这里的工作按照这样一个评审组可能需要的条件来打分,按权重排序(targets/indus/PROGRESS.md, prizebench.py):

为了提高第一层和第三层而做的尝试,得出了两个发现。铜板图画对应的是从模具重复压制的完整文本,而不是单个符号:在一半铜板上确定的图画意义,只能预测38块未见铜板中的1块。共有的双符号短语带有一种微弱的倾向(每次留出一段文本,命中率17%,p = 0.05),主要是大象短语706 33 923 740和树短语806 158。泰米尔纳德邦的刻划记号(Rajan 和 Sivanantham 2026,第 II 卷)用一种不需要符号等式的检验与印度河行作了比较。两个刻划元素一起出现时,它们有70.5%的时候保持同样的顺序,而印度河符号为88.0%,这个数字在 Keeladi 和 Thulukarpatti 都一样。就记录所见,刻划组合的有序程度低于印度河文字。

同样的循环还带来了两项结构上的补充。紧挨在计数之前的槽位,在两套语料中都由一个受限的集合来填充,即计数的标签:它最常见的十个符号在该槽位中分别占52%和58%,而在打乱的行中要少得多,其中部分是起首符,但不仅仅是起首符。而且,加入这条规则的语法,对未见过的行的解析优于打乱的行,差距略有扩大。

最有力的辅助性结果是一致性。在一处地点的行上拟合语法(包括其学习得到的部分),在另一处地点上打分,以相对于打乱行的差距来衡量:

字形手段、计数标签槽位以及“鱼/520”类别信号,在每座城市中、在印章和刻板上都表现一致。带笼形的符号从不取740或520,带笔画的罐几乎从不位于行末。一套语法体系通行于整个印度河世界,所以任何读法都必须处处与之相符。由于名字中没有前缀,要求该语言没有前缀,也进一步缩小了类型范围:WALS 语言属的85%和 Grambank 语系的77%被排除。

按这张评分表,什么才能赢得奖金:为大约七十个常见符号给出音值,把大多数记号读成同一种语言中合乎语法的短语。其意义必须与几种外部证据相符。方法必须通过线形文字B对照,必须能读出从未用于设定音值的文本,并且能由并非其构建者的专家复现。目前的工作提供了这样一项主张必须符合的语法和必须通过的检验。它没有提供任何读法。

13 仍未解决的部分

14 途中撤回的结论

先登记预测,意味着本项目自己的一些读法被后来的检验推翻了。它们保留在记录中,并列于此:

15 来源

脚本、登记的假设(PREDICTIONS.md)、每一组的结果(results/)以及工作笔记(NOTES.md)都在仓库文件夹 targets/indus/ 中。