速覽未破解 · 2,727項登記假設中有1,425項成立
- 文字
- 出發點是 Asko Parpola 的講座“Study of the Indus Script”(ICES 東京2005年,見 harappa.com)。其背後的銘文約有4,500件印章、刻板和陶片,大多數不到五個符號。
- 藏地
- 兩份獨立製作的機器可讀轉錄:一份是源自 Interactive Corpus of Indus Texts(ICIT;Wells 和 Fuls)的資料庫,另一份是 Mahadevan 1977年的索引(M77)。這裡將兩者逐個符號對應起來。Parpola 本人的Corpus of Indus Seals and Inscriptions的一份數字化版本作為第三重核對。
- 文字
- 約400–600個符號,大多從右往左書寫,沒有分詞符,沒有雙語對照,所記語言不明。
- 嘗試經過
- 首先,把 Parpola 講座中和他1994年讀法表中的每一個計數都重新算了一遍,併為他的泰米爾語檢驗設定了隨機基線。然後,在檢視資料之前,寫下並提交了247組假設,共2,727項。每一項都經過檢驗,無論成立與否都記錄在案,主要結果還在留出樣本上、並對照兩種可以讀懂的文字(線形文字B、烏爾第三王朝楔形文字)重新執行。
- 結果如何
- 一套詳細的語法,但沒有任何音值。名字以一個槽位結尾,其形式(740、520或某個結尾符)由名字的最後一個符號決定。書寫者從不在換行處拆開一對緊密結合的符號,也從不把名字與其詞尾拆開。數字與它們所計數的符號固定搭配。印章上的名字表現得像人名,與同樣長度的線形文字B名字一樣。Parpola 的星名讀法每一個都只依據一兩枚印章。
- 尚未解決
- 一切與語音有關的東西,以及語言本身。對照泰米爾納德邦獎金所需要的條件(第12節),決定一項解讀能否成立的那幾個層級幾乎為零。本專案自己早先的幾條結論被後來的檢驗推翻而撤回;它們列在第14節。
01 語料與符號
Parpola 的論證都是計數:最常見的符號出現得多頻繁,哪些符號一起出現,哪些從不一起出現。為了重新執行這些計數,本專案使用了兩份彼此獨立製作的轉錄。第一份是源自 Interactive Corpus of Indus Texts(Wells 和 Fuls)的資料庫,隨 indus-website 專案釋出:2,543件器物,11,253個符號,附有 CISI 器物編號、遺址和野外記錄的圖案。同一資料庫的一份更完整的匯出(5,680條記錄,附出土地點、地層、尺寸和材質)用於後來的大多數檢驗。就所核對的符號而言,它的符號總數與 Fuls 的Catalog of Indus Signs(2023)中刊印的數字十分接近。ICIT 的符號只有編號,所以這裡用資料庫自己的字型把每個符號畫出來,再對照 Parpola 的描述加以辨認。第二份轉錄是 Mahadevan 1977年的索引(2,906件文字)。兩份符號表透過對齊它們共有的文字聯絡起來:991行,96%的符號對應唯一的對應符號。第一套語料中缺少的1,664件 M77 文字,自始至終都用作獨立的復現樣本。

02 講座中的論斷,逐一核對
- 最常見的符號(“罐”,740)幾乎佔全部符號的10%:M77 中為9.9%,ICIT 中為11.3%。在南亞,它從不與自身相鄰(0次,而如果打亂每行內部的順序,預期為4.0次,p 約為0.007)。正如 Parpola 所說,它在每套語料中都只與自身相鄰一次,出現在同一枚出處不明的圓形印章上。
- 在海灣地區和美索不達米亞發現的印章以不尋常的順序使用常見符號。有一枚方形印章(阿曼 Salut)也不尋常,這與講座所說相反。
- 魚形符號佔印章符號的9.7%。蟹與魚形符號相鄰的頻率遠高於隨機,但它旁邊是帶標記的魚,而不是素魚。
- “7 + 魚”被讀作大熊座,在兩套語料中都只出現一次,在哈拉帕的一枚印章上。“無花果 + 魚”即北極星,出現兩次(M-172,以及 M-414,已對照 CISI 第1卷中的照片核實)。
- 魚之前的數字。Parpola 稱“6 + 魚”(昴星團)是最常見的“數字 + 魚”序列。把每件不同的文字只計一次,最常見的是“2 + 魚”(113件文字),其次是“3 + 魚”(28件);“6 + 魚”只有8件。在 CISI 數字化版本所覆蓋的印章上,Parpola 本人的轉錄給出同樣的答案:2 + 魚十三次,6 + 魚零次。如果把每個副本都計入,或改用 Mahadevan 的轉錄,2 + 魚仍然最常見(117例和123例,而6 + 魚為9例和12例)。三份轉錄、兩種計數方式結論一致,所以這種差異並不取決於 ICIT 如何辨認符號。“2”中有一部分是長筆畫對(113行中的51行),Parpola 不把它讀作數字,而是讀作vēḷ,“長筆畫對 + 魚”就是他的“金星”。即便去掉這部分,短筆畫的2 + 魚(60)也遠多於6 + 魚(8)。

03 1994年的讀法與泰米爾語檢驗
Parpola 1994年的書最後附有一張24個讀法的表,以及他所依據的99個帶mīn“魚、星”的泰米爾語複合詞的清單。在兩套語料中,以下這些符號對都是真實的、反覆出現的單位:3 + 魚、6 + 魚、眼睛 + 眼睛、爐灶 + 圓環、圓環 + “空間”,以及“空間” + 魚。魚 + 魚、7 + 魚、無花果 + 魚、無花果 + “空間”和蟹 + 素魚則處於或低於隨機水平。書中說魚之前的數字“僅限於3、4、6和7”。語料中有1、2、3、4、6、7和12,從來沒有5,儘管泰米爾語中有對應5的星名。
每個讀法背後的檢驗,都是它所給出的複合詞是不是一個真實的泰米爾語詞。一條隨機基線表明這種檢驗有多弱。預先確定98個圖畫概念。表示該圖畫的某個泰米爾語詞,有15%的機率恰好是 Parpola 的某個泰米爾語星名的開頭;如果允許這些讀法所用的語音寬容度,機率是30%。
04 銅板:七個“符號 = 影象”等式
摩亨佐-達羅的銅板成套出現,每套由相同的副本組成。每塊一面有銘文,另一面是動物或人物,而在某些套中,單個符號取代了圖畫,銘文相同。把 Parpola 對46套銅板的分類與轉錄相匹配,得出七個等式:
- 無花果 + 蟹合體777 = 捻角山羊以及帶角的弓箭手;
- 符號749 = 捻角山羊;
- 341 = 犀牛;
- 753 = 野兔;
- 一個透鏡形符號 = 長角公牛;
- “3 700 900 165” = 一頭帶斑點的公牛。
這些是這種文字所能提供的最可靠的意義。圖畫符號749、341和753只出現在銅板上,777另外還出現在一枚印章上:沒有任何印章名字用到它們。許多印章文字開頭的那個起首符,從不出現在銅板文字的開頭(198件中0件)。銅板的表現與印章不同。在第9節的捕獲–再捕獲檢驗中,銅板文字構成一小組封閉的標籤,像稱號一樣在全城重複出現,而印章文字則各不相同。銅板上的圖畫還按摩亨佐-達羅的城區聚集:只有文字的銅板在 DK-G 南區,動物系列在 VS-A 區,人物和合成形象在衛城土丘上。

05 哪種語言?以梵語和蘇美爾語作對照
對梵語(Monier-Williams)和蘇美爾語(ePSD2 詞表)也做了同樣的檢驗。一幅圖畫得出一個星名的機率,梵語為19%,蘇美爾語為10%,泰米爾語為15%。“魚 = 星”這個雙關也不是達羅毗荼語獨有:蘇美爾語mul是“星”,也是一種魚;梵語有ṛṣi(一種魚;大熊座的七仙人)。不過,在2,895種語言中(CLICS4),“魚”和“星”的日常用詞只在三種語言中相同,沒有一種在南亞,而古泰米爾語mīn就是其中之一。所以,每一個魚形讀法的第一步確實是達羅毗荼語所特有的,儘管建立在它之上的泰米爾語複合詞檢驗並非如此。魚之前的數字並不符合泰米爾語的星名:只有6 + 魚(昴星團)出現得偏多,而5 + 魚從未出現。
06 其餘部分如何完成:檢驗前登記的假設
上述核對之後的所有工作,都是作為登記在案的預測來執行的。每一組的假設及其閾值都寫進 targets/indus/PREDICTIONS.md 並在任何指令碼檢視資料之前提交到倉庫。然後執行檢驗,記錄結果成立還是失敗,不改動閾值。以這種方式執行了247組,共2,727項假設:1,425項成立,1,302項失敗。從第176組起,它們以迴圈方式執行,按一個固定的進展指標打分(targets/indus/PROGRESS.md)。凡是某項檢驗後來被證明提法不當,或某個指令碼有 bug,記錄中都會註明,並在原結果旁給出更正後的結果。
計數針對的是不同的文字。同一枚印章在許多封泥上壓印,或者一批相同的銅板,都只計一次,因為重複的副本會誇大任何模式。主要結果都在未用於發現它們的樣本上重新執行過:Mahadevan 的 M77 補充部分、較小的遺址、不含銅板的更完整語料,以及 Parpola 的 CISI 轉錄。兩種可以讀懂的文字作為對照:線形文字B(邁錫尼希臘語,取自 DAMOS 資料庫)和烏爾第三王朝時期的印章銘文(蘇美爾語,取自 ORACC 的22,402個印文)。
07 一種讀法必須符合的語法
- 同一套詞彙上的四類文字。幾乎每一行都是以下之一:帶詞尾的名字,以“結尾符”結束的行,計數(數字加所計之物),或者不帶詞尾的單純序列。2,722個不同的行中只有3行不屬於這四類中的任何一類。每個符號在全部四種框架中都保持其位置和搭配。
- 詞尾槽位是一個由名字最後一個符號選擇的詞形變化表。名字以罐740、“箭”520、十幾個結尾符之一,或740後接一個疊加結尾符來結束。然後可選地接400,或者90(只接在740之後)。名字的最後一個符號預示它取哪種詞尾(對此建立的模型能預測 Mahadevan 那份獨立轉錄中95%的詞尾)。881個名字中只有5個同時與740和520一起出現過。740和520從不相鄰。
- 兩種詞尾並不相同。740是開放詞尾:凡是以晚期地層中才首次出現的主詞構成的名字,都取這個詞尾(34箇中的34個)。520名字在163個名字中只用了26個不同的主詞,大多是魚形符號,還包括一些固定表達,例如印章結束套語“705(或706)+ 長3 + 520”。
- 名字是中心語居後的。詞尾跟在名字的最後一個符號之後,而不是第一個。名字在已有名字的前端增長,數字位於所計之物之前(472例對106例)。這是達羅毗荼語和印度-雅利安語的語序,與蘇美爾語和埃蘭語相反。沒有數的一致,也沒有長串的字尾:詞尾槽位短小且封閉。
- 換行尊重這些單位。在多行的印章和銅板上,無論行序如何,書寫者從不把30個結合最緊密的符號對中的任何一對拆到兩行(0次,隨機預期約5次)。他們幾乎從不拆開一個反覆出現的名字單位,或者把名字與其詞尾拆開。每一行都是四類文字之一的完整文字,而如果某一行是名字,另一行就是一個獨立的欄位。符號1和2並不充當分詞符,這一點 Fuls(2024)在反駁 Wells(2011)時已有論述。
- 數字與它們所計數的符號固定搭配。同一套數字系統用於各類文字,用短筆畫、長筆畫和分層筆畫書寫。在名字內部,某個符號之前的數字是固定的,彷彿“數字 + 符號”是一個詞。同一符號之前最常見的數值,在摩亨佐-達羅和哈拉帕之間只有39%的符號一致,“2 + 魚”是共有的例外。但真實的計數也差不多同樣具有地方性:線上形文字B中,17種物品裡有8種,其最常見的數量在克諾索斯和皮洛斯之間不同。所以這看起來像是計數,而不是某種命名習俗。
- 可預測性。一個基於符號位置和相鄰符號的模型,對留出文字的預測為每符號4.66位元。半數符號可以從其兩側鄰居猜出。而且這種文字有禁止的組合:20對常見符號,按隨機本應相鄰五次或更多,卻從未出現,這類組合是打亂後各行中的17倍。例如,魚220和240從不直接出現在390之前。
08 第二份轉錄,以及他人的論斷
- Parpola 本人的轉錄結論一致。Corpus of Indus Seals and Inscriptions的開放數字化版本覆蓋了摩亨佐-達羅印章 M-1 至 M-184。在這些印章上,它與 ICIT 轉錄在器物長度上的一致率為96%,在符號位置上為92%,在最後一個符號上為98%。分歧都落在罕見符號上,而在 Parpola 的編號體系中,詞尾規則同樣成立。
- Mahadevan 的“城市的商人”(2014),即短語255 435 690 740,是一個真實的單位。它出現在22件不同的文字中,分佈於三處遺址,跟在九個不同的符號之後。但它的前半部分後面接的要麼是“690 740”,要麼是一個“持有者”結尾符,而不是去修飾其他名詞。而他讀作名字的那些“持有者”符號,表現得像結尾符:它們在196次中只有1次是名字的主詞。
- 蘇聯團隊關於屈折變化的論斷,按 Parpola 的轉述,照其原樣是不成立的。740在印章上處於末尾的頻率並不比在銅板上更高,而它後面的一道筆畫也很少位於文字結尾。
- 是什麼樣的文字。在相同的樣本量(5,000個記號)下比較,印度河符號介於線形文字B的符號與其詞之間,更接近符號:495個型別,對比198和2,128,罕見型別的比例和可預測性也居於兩者之間。這符合一種有幾百個符號的語素音節文字,也就是 Fuls(2023)根據熵得出的那一類。而在重複性指標上,印度河符號則更像烏爾第三王朝的印章銘文,這是一種簡短程式化體裁的標誌。
- “重複太少,不可能是文字”(Farmer、Sproat 和 Witzel 2004)這一論斷,在同一體裁的對照上站不住腳。5–7個符號的印度河印章行,有9.5%的情況出現符號重複。5–7個詞的烏爾第三王朝印章銘文,有13.4%出現詞重複。兩者都遠低於打亂後的文字(28%和34%),這對真實文字來說是很正常的。
- 已發表的金鑰。對 Yajnadevam 的梵語金鑰、Fairservis 的達羅毗荼語音值和 Parpola 的30個音值進行了打分,看每把金鑰能把多少語料變成詞典中的詞,並與把同一把金鑰的音值打亂後的副本相比較。沒有一把金鑰讀出自己所聲稱的語言的效果好於其打亂版本。一把盲目擬合語料的金鑰,能把約93%的語料讀成梵語,也能同樣讀成達羅毗荼語或蘇美爾語,所以單憑閱讀率本身不構成證據。不過,這種詞典得分線上形文字B上也失效了:Ventris 的正確音值只勝過其打亂版本的59–89%。於是另建了一個能透過檢驗的打分器:每一行解碼結果都由該語言的字元模型來評分。在留出的線形文字B行上,配合希臘語模型,它把 Ventris 的金鑰排在全部100個打亂版本之上,而配合梵語模型則不然。用這個打分器檢驗,沒有任何一把像樣的已發表金鑰能讀出它所聲稱的語言:Fairservis 的金鑰被100個打亂版本中的12個擊敗,Yajnadevam 的被7個擊敗,而 Parpola 和 Mahadevan 的金鑰則比它們的大多數打亂版本還差。Kak 的七符號金鑰之所以能透過,只是因為它把sa放在了行末的罐740上,任何帶有常見字尾-sa的字尾型語言都會因此得分。
- 自由擬合音值,在一種已知文字上會選錯語言。在一半線形文字B文字上,用計算機把符號音值分別擬合到希臘語、梵語、達羅毗荼語和蘇美爾語,每種語言給予同樣的自由度,然後在另一半文字上打分。梵語擬合得最好,希臘語排在最後或第三,Ventris 的音值一個也沒有復原出來。所以,在自由選擇音值之後聲稱印度河文字“符合”某種語言,並不構成支援該語言的證據。
09 什麼樣的名字?
一段印章文字很短,位於一隻動物下方,以一個語法槽位結尾。它是人名、稱號或官職,還是神名?捕獲–再捕獲,即生態學家用兩個相互重疊的樣本來估計種群數量的方法,提供了一種不需要音值就能提出這個問題的途徑。把摩亨佐-達羅印章上的名字和哈拉帕印章上的名字當作從同一個種群中捕獲的兩批。有多少名字同時出現在兩批中,就能說明整個種群有多大。
- 名字是一個龐大的開放種群;主詞則是一個封閉的種群。1,279枚印章上有585個不同的名字,只有20個同時出現在兩座城市。據此估計種群約有3,000–5,500個名字(Lincoln–Petersen 估計和 Chao1 估計),且92%的名字只出現在一枚印章上。主詞(名字的最後一個符號)幾乎都已經見過:已知約130個,估計約150–220個。在一座城市內部也是如此,無論是比較摩亨佐-達羅的兩個區域(觀察數的7.4倍),還是比較其早期和晚期地層,在 Mahadevan 的那份獨立轉錄中也一樣。
- 線形文字B上的對照。對邁錫尼希臘語做同樣的檢驗,以克諾索斯和皮洛斯為兩批捕獲,可以把已知的詞類區分開來。人名給出一個龐大的種群(觀察數的3.6倍,18%共有,71%只見於一塊泥板)。稱號和職業給出一個小的、共有的種群(1.6倍,50%共有)。比較又在匹配長度的條件下重做了一遍,因為無論含義如何,較長的單位總是更多樣。在三個符號時,印度河名字為3.0,三音節的線形文字B名字為3.7;在四個符號時,為3.0對3.4。而且,真實的名字在不同遺址之間重複出現的頻率,是同樣長度的隨機符號組合的25倍,線形文字B的名字也是如此。
- 烏爾第三王朝印章上的對照使這一檢驗所能說明的東西更加明確。蘇美爾人名來自一個有限的名字型檔,由許多人共用,所以單看人名,它們就像稱號(觀察數的2.0倍,31%共有)。只有完整的印章銘文,即“名字 + 稱號 + 父名”,才像印度河名字一樣具有個體性(17.5倍,3%共有)。所以這項檢驗衡量的是整段文字的個體性有多強,而不是它是否為某個人命名。印度河印章文字是各自獨立的組合,就像線形文字B的人名和完整的美索不達米亞印章銘文。與美索不達米亞銘文不同的是,它們幾乎從不帶第二個名字(印章中佔1.6%,對比65%),也幾乎不帶單獨的稱號行(13%,對比71%)。
- 名字與其印章上的動物沒有關聯。帶同一個名字的印章,刻同一種動物的頻率並不比任意兩枚印章更高(12%對11%),也沒有任何符號與大象、瘤牛或祭祀標杆的關聯超出隨機水平。有十五個名字出現在三處或更多遺址。“590 390 740”出現在五處:Allahdino、昌胡-達羅、朵拉維拉、哈拉帕和摩亨佐-達羅。
10 地點與時間
- 文字不隨出土地點而變。更完整的語料記錄了每件器物在摩亨佐-達羅的出土位置(區域、街區、房屋)。印章上寫的內容與它的出土地點無關。文字相同的印章沒有顯著的聚集,同一所房屋出土的印章也沒有共享的特殊詞彙。文字型別、詞尾、動物和文字長度都不因城區而異,街道上發現的印章與房屋中發現的印章,是名字的比例一樣高。
- 語法保持不變。在兩座城市的早期和晚期地層之間,詞尾槽位(520的佔比、結尾符、400和90、疊加結尾符)和計數文字都沒有變化。數字有變化,而在摩亨佐-達羅,名字的開頭方式發生了轉變。以33個高頻起首符號之一開頭的長名字,從39%上升到66%,方形印章和長方形印章都是如此。但摩亨佐-達羅的主詞和整體符號構成並沒有向哈拉帕靠攏,所以這是名字開頭方式的區域性變化,而不是兩座城市用法的融合。
- 字形變體隨器物和製作者而定。同一符號的兩種寫法,在同一件器物上、在同一文字的不同副本之間,一致的程度都高於隨機,並且取決於載體材質。沒有任何家族習慣的痕跡,也沒有隨時間的漂移。
- 外來名字打破了語法。海灣地區和美索不達米亞出土的印章使用普通的印度河符號,卻沒有詞尾槽位、名字單位和常見的開頭。在印度河模型下,它們的得分為每符號6.5位元,而且在行內大量使用筆畫符號。這也許暗示,在拼寫外來名字時,筆畫是按讀音使用的。
11 就語序所能顯示的而言,這種語言
沒有音值,就只有語序和語法的形態能說明語言。有四個特徵指向同一個方向:
- 數字位於所計之物之前;
- 名字是中心語居後的;
- 詞尾是一個由名詞決定的簡短類別字尾,其他地方沒有數或類別的一致;
- 名字的第一個成分來自一個開放集合,沒有一套字首。
這符合達羅毗荼語和印度-雅利安語,而不利於把中心語放在前面的蘇美爾語和埃蘭語。還有兩點進一步縮小了範圍。詞尾把人與魚形名字(Parpola 的星)區分開來,而蒙達語的語法不會這樣做。而且,“魚 = 星”這個詞在南亞只見於達羅毗荼語。兩者合起來偏向達羅毗荼語,但前提是魚形名字確實是星名,而且這裡沒有任何東西能單憑語序把達羅毗荼語和印度-雅利安語區分開。各語系的預期依據的是標準型別學,並非針對每種語言逐一核對過的來源。
候選語言中的名字列表又帶來了兩個結果。烏爾第三王朝印章上的蘇美爾人名固定的是第一個成分(Ur-、Lu-、Nin-、神名符號),而印度河名字固定的是最後一個成分,線形文字B和梵語名字也是如此。這再一次排除了蘇美爾式的名字結構。在達羅毗荼語和印度-雅利安語之間,這些列表無法作出判斷。印度河名字的長度更接近梵語名字。一種詞尾佔主導(740結束了82%的名字),則更接近古泰米爾語人名,其中67%以陽性字尾-aṉ結尾,Mahadevan 正是把740讀作這個字尾。隨後,一個更貼近的印度-雅利安語參照又讓論證掉轉了方向。Lüders 的早期婆羅米文銘文列表(1912)給出了桑吉和巴爾胡特的374個俗語(Prakrit)捐獻者名字,約公元前200年至公元400年。這些是捐獻器物上的人名,在時間、地點和體裁上都與印度河印章接近。印度河名字的構成與它們相似:
- 兩者的開放程度差不多(觀察數的5.1倍對5.9倍);
- 在長度和封閉程度上,它們比古泰米爾語名字更接近;
- 它們都以一套複合中心語結尾。最常見的十個俗語中心語(-rakhita、-guta、-dina、-mita……)覆蓋41%的名字,最常見的十個印度河中心語覆蓋43%。
俗語捐獻者名字也帶有一個幾乎普遍的詞尾,即捐獻套語中的屬格-sa。所以,像740這樣佔主導的詞尾,既符合泰米爾語的-aṉ,也同樣符合印度-雅利安語捐獻者式的套語。與之相應的達羅毗荼語檢驗,用的是捐獻記錄中的泰米爾語名字:取自 DHARMA 泰米爾語銘文英譯本的1,396個名字,7世紀以後。它使證據分成兩邊:
- 更接近俗語捐獻者名字的:複合中心語的庫存(印度河43%,俗語35%,泰米爾語16%),以及最後一個成分的固定程度。
- 更接近泰米爾語名字的:名字長度(幾乎相同),以及單一佔主導的字尾(740見於82%的名字,泰米爾語-aṉ見於47%,最常見的俗語詞幹詞尾見於23%)。
因此,名字結構排除了蘇美爾型別,但無法在印度-雅利安語和達羅毗荼語之間作出判斷。此外,泰米爾語記錄比俗語列表晚得多,其中許多名字源自梵語。
隨後又根據 Mahadevan 的Early Tamil Epigraphy的頁面掃描件,建立了一份同時代的達羅毗荼語列表:取自泰米爾-婆羅米文洞窟銘文的104個捐獻者名字,約公元前2世紀至公元4世紀。它在時期和體裁上都與俗語列表相匹配。
- 更接近俗語名字的:全部三項結構指標。最後一個成分的固定程度:印度河0.83,俗語0.90,泰米爾-婆羅米文1.45。長度。以及中心語庫存:43%、35%和30%。
- 更接近泰米爾-婆羅米文名字的:佔主導的字尾(82%,對比-aṉ的73%)。但這一反差部分是資料造成的,因為 Lüders 給出的俗語名字不帶格詞尾。
按這些指標,印度河名字看起來更像早期印度-雅利安語的捐獻者名字,而不是同時代的泰米爾語名字。後來的一項對照推翻了這一點。加入了型別學上相匹配的誘餌:日語和土耳其語的人名,這兩種語言具有與印度河相同的語序特徵。兩份南亞捐獻者列表都勝過了這兩個誘餌,但它們是銘文,而誘餌是名字列表。當兩邊的體裁都匹配時(取自 Monier-Williams 的梵語名字和桑伽姆詩人的名字,對比同樣的日語和土耳其語列表),日語最接近印度河名字,在資料的兩半中都是如此。早先的偏向是體裁造成的,而不是語言。這類名字結構統計無法選出一種語言。
世界型別學能縮小範圍,但也僅此而已。對照 WALS 和 Grambank 資料庫檢驗印度河的語序特徵,可以排除世界上81%的語言屬(Grambank 語系的68%)。達羅毗荼語、印度-雅利安語、蒙達語、布魯夏斯基語、突厥語、蒙古語、日語和朝鮮語全都還在。唯一的類別訊號(以魚為中心語的名字取520,而以人、工具和植物為中心語的名字取740),在摩亨佐-達羅、哈拉帕和其他遺址都成立,早期和晚期都一樣。它既符合達羅毗荼語的“人/非人”區分,也同樣符合梵語的性別解讀,因為星名大多是陰性的。
12 對照獎金要求:一張評分表
2025年1月,泰米爾納德邦政府懸賞一百萬美元,獎勵能“令考古專家滿意地”解讀這種文字的人。此後沒有公佈進一步的規則。這裡的工作按照這樣一個評審組可能需要的條件來打分,按權重排序(targets/indus/PROGRESS.md, prizebench.py):
- 經過核實的意義:被讀出意義、並由外部證據(同一件器物上的圖畫、其用途、其出土地點)證實的符號。目前:佔符號記號的0.008%,即銅板上的圖畫符號。數字(16.6%)另計。離讀出只差一步的,有十一段完整文字,其所指由圖畫確定。每一段都寫在三塊或更多塊逐一製作、帶有同一幅圖畫的銅板或刻劃板上:野兔、弓箭手、大象、山羊、長吻鱷、一條魚、公牛和“環”(對照打亂的圖畫,p = 0.001)。有十五個雙符號短語,在確實不同的文字之間、在逐一製作的刻板上以及在不同的模製圖案之間,都透過了同樣的檢驗,其中包括帶葉形符號的樹短語806 158。同一文字的不完整轉錄在計數前已經合併。這些文字和短語合計佔符號記號的0.76%,它們為一個場景貼上了標籤,但並沒有被讀出來。不過它們是區域性的標籤:一個在刻劃板上與某幅圖畫相伴的短語,並不能預測模製板上的圖畫,反之亦然(40箇中1個)。這一方法先線上形文字B上做過檢驗,在那裡由表意符號充當圖畫的角色。它挑出了143個與某個表意符號相伴的詞,隨機預期只有2個,並復原了已知的配對,例如 a-mo-ta“車輪”與車輪表意符號。在印章上,除了預設的獨角公牛之外,這一方法對任何動物都一無所獲,所以印章文字並不命名其動物。圖畫還從另一個方向檢驗了語法。在此前任何檢驗都沒有用過的模製板上,含有詞尾、標記或數字的符號對,所搭配的不同圖畫遠多於由兩個實義符號組成的符號對(每次出現0.45幅不同圖畫,對比0.28幅,p = 0.001)。被語法認定為語法成分的符號,本身並不帶有所指。
- 陽性對照:方法必須首先復原一個已知答案,即從線形文字B得出希臘語。六種方法中有三種透過:一種音值替換檢驗、第8節的字元模型金鑰打分器,以及圖畫所指方法。詞典得分和自由擬合金鑰都失敗了。
- 未見過的文字:音值先固定下來,再拿到從未用於設定它們的文字上去試,就像 Ventris 的音值在他解讀之後發現的皮洛斯泥板上所經受的檢驗。目前:沒有,因為沒有任何音值透過檢驗。
- 輔助性的:考古上的一致性、對照同體裁誘餌的語言檢驗,以及預測任務。一個被隱藏的符號,有40%的時候第一猜就猜中,62%的時候落在前五名之內(僅憑頻率為9.6%和22%)。提升來自按字形家族讀取符號,以及折扣平滑。(以該行的起首符號為條件而帶來的一項表面提升其實是資訊洩漏,因為第一個符號是由它自己預測的,已經撤回。)這裡的字形家族是指籠形、罐或 U 形內部的筆畫、魚身上的記號。無論家族是取自 ICIT 的編號,還是取自 Parpola 本人的符號描述,效果都成立,而從上下文學到的類別則完全沒有這種效果。在此基礎上校準得更好的模型,能降低每符號的位元數,但並不能提高第一猜的命中率。
為了提高第一層和第三層而做的嘗試,得出了兩個發現。銅板圖畫對應的是從模具重複壓制的完整文字,而不是單個符號:在一半銅板上確定的圖畫意義,只能預測38塊未見銅板中的1塊。共有的雙符號短語帶有一種微弱的傾向(每次留出一段文字,命中率17%,p = 0.05),主要是大象短語706 33 923 740和樹短語806 158。泰米爾納德邦的刻劃記號(Rajan 和 Sivanantham 2026,第 II 卷)用一種不需要符號等式的檢驗與印度河行作了比較。兩個刻劃元素一起出現時,它們有70.5%的時候保持同樣的順序,而印度河符號為88.0%,這個數字在 Keeladi 和 Thulukarpatti 都一樣。就記錄所見,刻劃組合的有序程度低於印度河文字。
同樣的迴圈還帶來了兩項結構上的補充。緊挨在計數之前的槽位,在兩套語料中都由一個受限的集合來填充,即計數的標籤:它最常見的十個符號在該槽位中分別佔52%和58%,而在打亂的行中要少得多,其中部分是起首符,但不僅僅是起首符。而且,加入這條規則的語法,對未見過的行的解析優於打亂的行,差距略有擴大。
最有力的輔助性結果是一致性。在一處地點的行上擬合語法(包括其學習得到的部分),在另一處地點上打分,以相對於打亂行的差距來衡量:
- 在摩亨佐-達羅學習得到的語法,解析哈拉帕的行幾乎與解析本地的行一樣好(43.8分對44.8分),反過來也成立。
- 在兩座城市上學習得到的語法,能解析較小的遺址(36.1)。
- 在印章上學習得到的語法,能解析刻板(43.6)。
- 在哈拉帕晚期學習得到的語法,能解析早期地層(27.0)。
字形手段、計數標籤槽位以及“魚/520”類別訊號,在每座城市中、在印章和刻板上都表現一致。帶籠形的符號從不取740或520,帶筆畫的罐幾乎從不位於行末。一套語法體系通行於整個印度河世界,所以任何讀法都必須處處與之相符。由於名字中沒有字首,要求該語言沒有字首,也進一步縮小了型別範圍:WALS 語言屬的85%和 Grambank 語系的77%被排除。
按這張評分表,什麼才能贏得獎金:為大約七十個常見符號給出音值,把大多數記號讀成同一種語言中合乎語法的短語。其意義必須與幾種外部證據相符。方法必須透過線形文字B對照,必須能讀出從未用於設定音值的文字,並且能由並非其構建者的專家復現。目前的工作提供了這樣一項主張必須符合的語法和必須透過的檢驗。它沒有提供任何讀法。
13 仍未解決的部分
- 沒有任何符號具有證據所迫使的音值,語言也沒有確定。除上述結構之外,內部檢驗已經走到盡頭。最後幾輪大多得出零結果和更正。剩下的需要新材料:一份雙語銘文、新出土的帶銘文器物,或者 CISI 第2卷和第3卷的數字化版本。(完整的 ICIT 資料庫這裡已經在用:匯出包含全部5,680條記錄;分析使用其中3,681件乾淨的文字,把殘損文字放在一邊。)
- 銅板上的七個“符號 = 影象”等式(749、341、753、777、透鏡形符號)是最可靠的意義。任何語言的讀法都必須與之相符。
- 一個印度河名字是否把人名和官職或世系壓縮在一個單位中,就像美索不達米亞銘文把它們分散在幾行中那樣,這仍是未解決的問題(見第14節)。
14 途中撤回的結論
先登記預測,意味著本專案自己的一些讀法被後來的檢驗推翻了。它們保留在記錄中,並列於此:
- 一份表音符號候選名單(46個與相鄰符號自由組合的符號,就像線形文字B的表音符號)在全部三項登記檢驗中都失敗了。與之相關的發現,即罕見名字使用更自由的符號,線上形文字B中也出現了,所以這是罕見詞的普遍效應。
- “兩套數字系統”(早期的一種解讀)變成了一套具有幾種筆畫形式的數字系統。在哈拉帕的刻板上,長筆畫與計量符號700搭配。
- “官職 + 名字”。一種在類似稱號的第一個符號與類似人名的名字其餘部分之間的對比,結果發現是在拿單個符號與多符號單位作比較。單個符號幾乎按定義就是一個封閉集合。控制了長度之後,只剩下第一個符號與印章動物之間的一種微弱聯絡。
- “數字複合詞是地方性的命名習俗”。線形文字B的計數結果同樣具有地方性,所以這一條被撤回,改為“具有地方性,計數本來就是如此”。
- “摩亨佐-達羅向哈拉帕趨同”。這一條被更正為名字開頭方式的區域性變化(第10節)。
- “印度河名字是人名”。這一條經烏爾第三王朝對照被收窄為“各自獨立的組合”(第9節)。
- “印度河名字結構更接近印度-雅利安語”。體裁匹配之後,一份日語誘餌列表更為接近。這種偏向來自資料都是銘文(第11節)。
- “共有短語能預測刻板上的圖畫”(在一種劃分上 p = 0.001)。第三種劃分失敗了,每次留出一段文字則只得到 p = 0.05。那只是一種有利的劃分(第12節)。
15 來源
- A. Parpola,“Study of the Indus Script”,Transactions of the International Conference of Eastern Studies 50(2005),28–66,harappa.com;Deciphering the Indus Script(劍橋,1994)。
- J. P. Joshi 和 A. Parpola,Corpus of Indus Seals and Inscriptions 1(赫爾辛基,1987);其開放數字化版本,mayig/indus-valley-script-corpus(MIT)。
- indus-website 專案源自 ICIT 的語料(github.com/yajnadevam/indus-website);A. Fuls,Corpus of Indus Inscriptions(柏林,2022)和A Catalog of Indus Signs(柏林,2023);A. Fuls,“Comparison of Linear Elamite and Indus Writing Systems”,Iranian Journal of Archaeological Studies 14.1(2024),3–16。
- I. Mahadevan,The Indus Script: Texts, Concordance and Tables(1977),機器可讀版本見 github.com/joyboseroy/indus_decipher;I. Mahadevan,Dravidian Proof of the Indus Script via the Rig Veda: A Case Study(Bulletin of the Indus Research Centre 4,2014)。
- 語言參照:H. Lüders,A List of Brahmi Inscriptions(Epigraphia Indica X 附錄,1912;Internet Archive);DHARMA,Early Inscriptions of Āndhradeśa及泰米爾語語料(erc-dharma tfa-*,CC BY 4.0);維基百科,List of Sangam poets;Monier-Williams;I. Mahadevan,Early Tamil Epigraphy(Harvard Oriental Series 62,2003),附錄 II,取自 Internet Archive 掃描件。
- 對照:DAMOS,Database of Mycenaean at Oslo(線形文字B),配合 Tiripode 詞典;ORACC epsd2/admin/ur3(烏爾第三王朝印章銘文,CC0);Monier-Williams(Cologne Digital Sanskrit Lexicon);ePSD2;CLICS4;L. L. Merriam 和 A. Fuls,The Dravidian Database(Zenodo,2026)。
- 型別學與誘餌:M. S. Dryer 和 M. Haspelmath(編),WALS Online(2013),以及 H. Skirgård 等,Grambank(2023),均為 CLDF 發行版,CC BY 4.0;JMnedict(EDRDG,CC BY-SA 4.0);土耳其語人名計數(github.com/eoner/turkce_isimler)。
- 獎金與刻劃記號:2025年1月5日的公告(據Archaeology Magazine報道);K. Rajan 和 R. Sivanantham,Indus Signs and Graffiti Marks of Tamil Nadu: A Morphological Study(2025)和Inscribed Potsherds of Tamil Nadu: Graffiti and Tamiḻi,第 II 卷(2026),泰米爾納德邦政府考古局,取自Tamil Digital Library。
指令碼、登記的假設(PREDICTIONS.md)、每一組的結果(results/)以及工作筆記(NOTES.md)都在倉庫資料夾 targets/indus/ 中。