中文譯本 · 原作 Daniel Bourdeau《Unsolved Historical Ciphers》 以 CC BY 4.0 釋出,本頁由 JIC 翻譯,非原作者官方版本,譯文如有出入以英文原頁為準 · 檢視英文原頁 ↗
4 · 罐 · 97 · 400 | 806 845 61 407 850 900 740 = 帶角的弓箭手
255 435 690 740 · 705 33 520 · 名字 + 詞尾,從不被換行拆開

摩亨佐-達羅、哈拉帕及其他50處遺址 · 語素音節文字,沒有公認的解讀 · 約公元前2600–1900年 · 已嘗試,未讀出

印度河文字:Parpola 的解讀與2,727項登記在案的檢驗

Parpola 的達羅毗荼語讀法,以及隨後2,727項在檢驗前登記的假設,在兩套相互獨立的語料上執行,並以線形文字B和烏爾第三王朝印章作為對照:一種讀法必須符合的語法已經闡明,但沒有確立任何符號的音值。

Daniel Bourdeau · 釋出於 · 更新於

方法:未破解 · 程度:未獲得文字

速覽未破解 · 2,727項登記假設中有1,425項成立

文字
出發點是 Asko Parpola 的講座“Study of the Indus Script”(ICES 東京2005年,見 harappa.com)。其背後的銘文約有4,500件印章、刻板和陶片,大多數不到五個符號。
藏地
兩份獨立製作的機器可讀轉錄:一份是源自 Interactive Corpus of Indus Texts(ICIT;Wells 和 Fuls)的資料庫,另一份是 Mahadevan 1977年的索引(M77)。這裡將兩者逐個符號對應起來。Parpola 本人的Corpus of Indus Seals and Inscriptions的一份數字化版本作為第三重核對。
文字
約400–600個符號,大多從右往左書寫,沒有分詞符,沒有雙語對照,所記語言不明。
嘗試經過
首先,把 Parpola 講座中和他1994年讀法表中的每一個計數都重新算了一遍,併為他的泰米爾語檢驗設定了隨機基線。然後,在檢視資料之前,寫下並提交了247組假設,共2,727項。每一項都經過檢驗,無論成立與否都記錄在案,主要結果還在留出樣本上、並對照兩種可以讀懂的文字(線形文字B、烏爾第三王朝楔形文字)重新執行。
結果如何
一套詳細的語法,但沒有任何音值。名字以一個槽位結尾,其形式(740、520或某個結尾符)由名字的最後一個符號決定。書寫者從不在換行處拆開一對緊密結合的符號,也從不把名字與其詞尾拆開。數字與它們所計數的符號固定搭配。印章上的名字表現得像人名,與同樣長度的線形文字B名字一樣。Parpola 的星名讀法每一個都只依據一兩枚印章。
尚未解決
一切與語音有關的東西,以及語言本身。對照泰米爾納德邦獎金所需要的條件(第12節),決定一項解讀能否成立的那幾個層級幾乎為零。本專案自己早先的幾條結論被後來的檢驗推翻而撤回;它們列在第14節。

01 語料與符號

Parpola 的論證都是計數:最常見的符號出現得多頻繁,哪些符號一起出現,哪些從不一起出現。為了重新執行這些計數,本專案使用了兩份彼此獨立製作的轉錄。第一份是源自 Interactive Corpus of Indus Texts(Wells 和 Fuls)的資料庫,隨 indus-website 專案釋出:2,543件器物,11,253個符號,附有 CISI 器物編號、遺址和野外記錄的圖案。同一資料庫的一份更完整的匯出(5,680條記錄,附出土地點、地層、尺寸和材質)用於後來的大多數檢驗。就所核對的符號而言,它的符號總數與 Fuls 的Catalog of Indus Signs(2023)中刊印的數字十分接近。ICIT 的符號只有編號,所以這裡用資料庫自己的字型把每個符號畫出來,再對照 Parpola 的描述加以辨認。第二份轉錄是 Mahadevan 1977年的索引(2,906件文字)。兩份符號表透過對齊它們共有的文字聯絡起來:991行,96%的符號對應唯一的對應符號。第一套語料中缺少的1,664件 M77 文字,自始至終都用作獨立的復現樣本。

本頁所討論的符號及其 ICIT 編號
本頁所談到的符號,附 ICIT 編號和計數:罐740,魚系列(220素魚,235“帶頂”,233,231,240),蟹798,無花果772–786,無花果 + 蟹合體777,眼睛,雙曲線,壺700,數字,以及銅板符號806 845 61 407 850。影象:此處用 indus-website 字型繪製(ICIT 符號編號)。

02 講座中的論斷,逐一核對

摩亨佐-達羅條形印章 M-414 的印文
M-414,摩亨佐-達羅出土的一枚條形印章,印出的樣子。從右往左讀:一個不清楚的交叉符號,枝上帶橫槓的 U 形“無花果”,以及素“魚”。這是 Parpola 的第二個“無花果 + 魚”,即vaṭa-mīn“北極星”。影象:Corpus of Indus Seals and Inscriptions,第1卷(Joshi 和 Parpola 1987),p. 100,M-414 a。

03 1994年的讀法與泰米爾語檢驗

Parpola 1994年的書最後附有一張24個讀法的表,以及他所依據的99個帶mīn“魚、星”的泰米爾語複合詞的清單。在兩套語料中,以下這些符號對都是真實的、反覆出現的單位:3 + 魚、6 + 魚、眼睛 + 眼睛、爐灶 + 圓環、圓環 + “空間”,以及“空間” + 魚。魚 + 魚、7 + 魚、無花果 + 魚、無花果 + “空間”和蟹 + 素魚則處於或低於隨機水平。書中說魚之前的數字“僅限於3、4、6和7”。語料中有1、2、3、4、6、7和12,從來沒有5,儘管泰米爾語中有對應5的星名。

每個讀法背後的檢驗,都是它所給出的複合詞是不是一個真實的泰米爾語詞。一條隨機基線表明這種檢驗有多弱。預先確定98個圖畫概念。表示該圖畫的某個泰米爾語詞,有15%的機率恰好是 Parpola 的某個泰米爾語星名的開頭;如果允許這些讀法所用的語音寬容度,機率是30%。

04 銅板:七個“符號 = 影象”等式

摩亨佐-達羅的銅板成套出現,每套由相同的副本組成。每塊一面有銘文,另一面是動物或人物,而在某些套中,單個符號取代了圖畫,銘文相同。把 Parpola 對46套銅板的分類與轉錄相匹配,得出七個等式:

這些是這種文字所能提供的最可靠的意義。圖畫符號749、341和753只出現在銅板上,777另外還出現在一枚印章上:沒有任何印章名字用到它們。許多印章文字開頭的那個起首符,從不出現在銅板文字的開頭(198件中0件)。銅板的表現與印章不同。在第9節的捕獲–再捕獲檢驗中,銅板文字構成一小組封閉的標籤,像稱號一樣在全城重複出現,而印章文字則各不相同。銅板上的圖畫還按摩亨佐-達羅的城區聚集:只有文字的銅板在 DK-G 南區,動物系列在 VS-A 區,人物和合成形象在衛城土丘上。

最常見的銅板銘文及其計數和影象
最常見的銅板銘文,按書寫原樣(從右往左),附副本數、閱讀順序以及另一面的圖畫:野兔、弓箭手、大象、單獨出現的無花果 + 蟹合體。影象:此處用 indus-website 字型根據源自 ICIT 的語料繪製。

05 哪種語言?以梵語和蘇美爾語作對照

對梵語(Monier-Williams)和蘇美爾語(ePSD2 詞表)也做了同樣的檢驗。一幅圖畫得出一個星名的機率,梵語為19%,蘇美爾語為10%,泰米爾語為15%。“魚 = 星”這個雙關也不是達羅毗荼語獨有:蘇美爾語mul是“星”,也是一種魚;梵語有ṛṣi(一種魚;大熊座的七仙人)。不過,在2,895種語言中(CLICS4),“魚”和“星”的日常用詞只在三種語言中相同,沒有一種在南亞,而古泰米爾語mīn就是其中之一。所以,每一個魚形讀法的第一步確實是達羅毗荼語所特有的,儘管建立在它之上的泰米爾語複合詞檢驗並非如此。魚之前的數字並不符合泰米爾語的星名:只有6 + 魚(昴星團)出現得偏多,而5 + 魚從未出現。

06 其餘部分如何完成:檢驗前登記的假設

上述核對之後的所有工作,都是作為登記在案的預測來執行的。每一組的假設及其閾值都寫進 targets/indus/PREDICTIONS.md 並在任何指令碼檢視資料之前提交到倉庫。然後執行檢驗,記錄結果成立還是失敗,不改動閾值。以這種方式執行了247組,共2,727項假設:1,425項成立,1,302項失敗。從第176組起,它們以迴圈方式執行,按一個固定的進展指標打分(targets/indus/PROGRESS.md)。凡是某項檢驗後來被證明提法不當,或某個指令碼有 bug,記錄中都會註明,並在原結果旁給出更正後的結果。

計數針對的是不同的文字。同一枚印章在許多封泥上壓印,或者一批相同的銅板,都只計一次,因為重複的副本會誇大任何模式。主要結果都在未用於發現它們的樣本上重新執行過:Mahadevan 的 M77 補充部分、較小的遺址、不含銅板的更完整語料,以及 Parpola 的 CISI 轉錄。兩種可以讀懂的文字作為對照:線形文字B(邁錫尼希臘語,取自 DAMOS 資料庫)和烏爾第三王朝時期的印章銘文(蘇美爾語,取自 ORACC 的22,402個印文)。

07 一種讀法必須符合的語法

08 第二份轉錄,以及他人的論斷

09 什麼樣的名字?

一段印章文字很短,位於一隻動物下方,以一個語法槽位結尾。它是人名、稱號或官職,還是神名?捕獲–再捕獲,即生態學家用兩個相互重疊的樣本來估計種群數量的方法,提供了一種不需要音值就能提出這個問題的途徑。把摩亨佐-達羅印章上的名字和哈拉帕印章上的名字當作從同一個種群中捕獲的兩批。有多少名字同時出現在兩批中,就能說明整個種群有多大。

10 地點與時間

11 就語序所能顯示的而言,這種語言

沒有音值,就只有語序和語法的形態能說明語言。有四個特徵指向同一個方向:

這符合達羅毗荼語和印度-雅利安語,而不利於把中心語放在前面的蘇美爾語和埃蘭語。還有兩點進一步縮小了範圍。詞尾把人與魚形名字(Parpola 的星)區分開來,而蒙達語的語法不會這樣做。而且,“魚 = 星”這個詞在南亞只見於達羅毗荼語。兩者合起來偏向達羅毗荼語,但前提是魚形名字確實是星名,而且這裡沒有任何東西能單憑語序把達羅毗荼語和印度-雅利安語區分開。各語系的預期依據的是標準型別學,並非針對每種語言逐一核對過的來源。

候選語言中的名字列表又帶來了兩個結果。烏爾第三王朝印章上的蘇美爾人名固定的是第一個成分(Ur-、Lu-、Nin-、神名符號),而印度河名字固定的是最後一個成分,線形文字B和梵語名字也是如此。這再一次排除了蘇美爾式的名字結構。在達羅毗荼語和印度-雅利安語之間,這些列表無法作出判斷。印度河名字的長度更接近梵語名字。一種詞尾佔主導(740結束了82%的名字),則更接近古泰米爾語人名,其中67%以陽性字尾-aṉ結尾,Mahadevan 正是把740讀作這個字尾。隨後,一個更貼近的印度-雅利安語參照又讓論證掉轉了方向。Lüders 的早期婆羅米文銘文列表(1912)給出了桑吉和巴爾胡特的374個俗語(Prakrit)捐獻者名字,約公元前200年至公元400年。這些是捐獻器物上的人名,在時間、地點和體裁上都與印度河印章接近。印度河名字的構成與它們相似:

俗語捐獻者名字也帶有一個幾乎普遍的詞尾,即捐獻套語中的屬格-sa。所以,像740這樣佔主導的詞尾,既符合泰米爾語的-aṉ,也同樣符合印度-雅利安語捐獻者式的套語。與之相應的達羅毗荼語檢驗,用的是捐獻記錄中的泰米爾語名字:取自 DHARMA 泰米爾語銘文英譯本的1,396個名字,7世紀以後。它使證據分成兩邊:

因此,名字結構排除了蘇美爾型別,但無法在印度-雅利安語和達羅毗荼語之間作出判斷。此外,泰米爾語記錄比俗語列表晚得多,其中許多名字源自梵語。

隨後又根據 Mahadevan 的Early Tamil Epigraphy的頁面掃描件,建立了一份同時代的達羅毗荼語列表:取自泰米爾-婆羅米文洞窟銘文的104個捐獻者名字,約公元前2世紀至公元4世紀。它在時期和體裁上都與俗語列表相匹配。

按這些指標,印度河名字看起來更像早期印度-雅利安語的捐獻者名字,而不是同時代的泰米爾語名字。後來的一項對照推翻了這一點。加入了型別學上相匹配的誘餌:日語和土耳其語的人名,這兩種語言具有與印度河相同的語序特徵。兩份南亞捐獻者列表都勝過了這兩個誘餌,但它們是銘文,而誘餌是名字列表。當兩邊的體裁都匹配時(取自 Monier-Williams 的梵語名字和桑伽姆詩人的名字,對比同樣的日語和土耳其語列表),日語最接近印度河名字,在資料的兩半中都是如此。早先的偏向是體裁造成的,而不是語言。這類名字結構統計無法選出一種語言。

世界型別學能縮小範圍,但也僅此而已。對照 WALS 和 Grambank 資料庫檢驗印度河的語序特徵,可以排除世界上81%的語言屬(Grambank 語系的68%)。達羅毗荼語、印度-雅利安語、蒙達語、布魯夏斯基語、突厥語、蒙古語、日語和朝鮮語全都還在。唯一的類別訊號(以魚為中心語的名字取520,而以人、工具和植物為中心語的名字取740),在摩亨佐-達羅、哈拉帕和其他遺址都成立,早期和晚期都一樣。它既符合達羅毗荼語的“人/非人”區分,也同樣符合梵語的性別解讀,因為星名大多是陰性的。

12 對照獎金要求:一張評分表

2025年1月,泰米爾納德邦政府懸賞一百萬美元,獎勵能“令考古專家滿意地”解讀這種文字的人。此後沒有公佈進一步的規則。這裡的工作按照這樣一個評審組可能需要的條件來打分,按權重排序(targets/indus/PROGRESS.md, prizebench.py):

為了提高第一層和第三層而做的嘗試,得出了兩個發現。銅板圖畫對應的是從模具重複壓制的完整文字,而不是單個符號:在一半銅板上確定的圖畫意義,只能預測38塊未見銅板中的1塊。共有的雙符號短語帶有一種微弱的傾向(每次留出一段文字,命中率17%,p = 0.05),主要是大象短語706 33 923 740和樹短語806 158。泰米爾納德邦的刻劃記號(Rajan 和 Sivanantham 2026,第 II 卷)用一種不需要符號等式的檢驗與印度河行作了比較。兩個刻劃元素一起出現時,它們有70.5%的時候保持同樣的順序,而印度河符號為88.0%,這個數字在 Keeladi 和 Thulukarpatti 都一樣。就記錄所見,刻劃組合的有序程度低於印度河文字。

同樣的迴圈還帶來了兩項結構上的補充。緊挨在計數之前的槽位,在兩套語料中都由一個受限的集合來填充,即計數的標籤:它最常見的十個符號在該槽位中分別佔52%和58%,而在打亂的行中要少得多,其中部分是起首符,但不僅僅是起首符。而且,加入這條規則的語法,對未見過的行的解析優於打亂的行,差距略有擴大。

最有力的輔助性結果是一致性。在一處地點的行上擬合語法(包括其學習得到的部分),在另一處地點上打分,以相對於打亂行的差距來衡量:

字形手段、計數標籤槽位以及“魚/520”類別訊號,在每座城市中、在印章和刻板上都表現一致。帶籠形的符號從不取740或520,帶筆畫的罐幾乎從不位於行末。一套語法體系通行於整個印度河世界,所以任何讀法都必須處處與之相符。由於名字中沒有字首,要求該語言沒有字首,也進一步縮小了型別範圍:WALS 語言屬的85%和 Grambank 語系的77%被排除。

按這張評分表,什麼才能贏得獎金:為大約七十個常見符號給出音值,把大多數記號讀成同一種語言中合乎語法的短語。其意義必須與幾種外部證據相符。方法必須透過線形文字B對照,必須能讀出從未用於設定音值的文字,並且能由並非其構建者的專家復現。目前的工作提供了這樣一項主張必須符合的語法和必須透過的檢驗。它沒有提供任何讀法。

13 仍未解決的部分

14 途中撤回的結論

先登記預測,意味著本專案自己的一些讀法被後來的檢驗推翻了。它們保留在記錄中,並列於此:

15 來源

指令碼、登記的假設(PREDICTIONS.md)、每一組的結果(results/)以及工作筆記(NOTES.md)都在倉庫資料夾 targets/indus/ 中。