한국어 번역 · 원저 Daniel Bourdeau, 《Unsolved Historical Ciphers》는 CC BY 4.0으로 공개되었다. 이 페이지는 JIC가 번역했으며 원저자의 공식 판본이 아니다. 번역과 원문이 다를 경우 영어 원문이 우선한다 · 영어 원문 보기 ↗
4 · pot · 97 · 400 | 806 845 61 407 850 900 740 = 뿔 달린 궁수
255 435 690 740 · 705 33 520 · 이름 + 어미, 줄바꿈으로 결코 나뉘지 않음

모헨조다로, 하라파 외 50개 유적 · 표어음절 문자, 인정된 해독 없음 · 기원전 2600–1900년경 · 시도했으나 판독 못함

인더스 문자: Parpola의 해독과 등록된 검정 2,727건

Parpola의 드라비다어 판독, 그리고 검정 전에 등록한 가설 2,727건을 선문자 B와 우르 3왕조 인장을 대조군으로 삼아 서로 독립된 두 코퍼스에 돌렸다. 판독이 들어맞아야 할 문법은 제시되었으나, 확립된 기호 값은 없다.

Daniel Bourdeau · 게시 · 갱신

방법: 미해독 · 범위: 텍스트를 얻지 못함

한눈에 보기미해독 · 등록된 가설 2,727건 중 1,425건 유지

텍스트
출발점은 Asko Parpola의 강연 “Study of the Indus Script”(ICES Tokyo 2005, harappa.com에 게재)였다. 그 바탕이 되는 명문은 약 4,500개의 인장, 판, 도편으로, 대부분 기호가 다섯 개 미만이다.
소장처
서로 독립적으로 만들어진 기계 판독 가능한 전사 두 가지: Interactive Corpus of Indus Texts(ICIT; Wells와 Fuls)에서 파생된 데이터베이스와 Mahadevan의 1977년 용어 색인(M77). 여기서 둘을 기호 단위로 연결했다. Parpola 자신의 Corpus of Indus Seals and Inscriptions를 디지털화한 것이 세 번째 검증 자료로 쓰였다.
문자
약 400–600개의 기호로, 대부분 오른쪽에서 왼쪽으로 쓰였으며, 단어 구분자도, 이중 언어 자료도, 알려진 언어도 없다.
시도한 방법
먼저 Parpola의 강연과 1994년 판독 표에 나오는 모든 수치를 다시 계산했고, 그의 타밀어 검증에 우연 기준선을 부여했다. 그런 다음 데이터를 보기 전에 가설 247세트, 모두 2,727건을 적어 커밋했다. 각 가설을 검정해 유지되었는지 실패했는지를 기록했고, 주요 결과는 따로 떼어 둔 표본과, 읽을 수 있는 두 문자(선문자 B, 우르 3왕조 쐐기문자)에 대해 다시 돌렸다.
그 결과
음가 없는 상세한 문법. 이름은 한 자리로 끝나는데, 그 형태(740, 520 또는 종결자)는 이름의 마지막 기호가 정한다. 서기들은 결합된 쌍이나 이름과 그 어미를 줄을 넘겨 가르는 일이 결코 없다. 숫자는 그것이 세는 기호와 고정되어 있다. 인장의 이름은 같은 길이의 선문자 B 이름처럼 개인 이름으로 행동한다. Parpola의 별 이름 판독은 각각 인장 한두 개에 기대고 있다.
미해결
음성에 관한 모든 것, 그리고 언어. 타밀나두 상금이 요구할 기준(12절)에 견주면, 해독을 판가름하는 단계들은 거의 0이다. 이 프로젝트 자체의 앞선 결론 몇 가지는 나중의 검정으로 철회되었으며, 14절에 나열해 두었다.

01 코퍼스와 기호

Parpola의 논증은 수치다. 가장 흔한 기호가 얼마나 자주 나오는지, 어떤 기호들이 함께 서는지, 어떤 기호들은 결코 그러지 않는지. 이를 다시 돌리기 위해 이 프로젝트는 서로 독립적으로 만들어진 두 전사를 썼다. 첫째는 indus-website 프로젝트와 함께 공개된, Interactive Corpus of Indus Texts(Wells와 Fuls)에서 파생된 데이터베이스로, 대상물 2,543개, 기호 11,253개이며 CISI 대상물 번호, 유적, 문양이 딸려 있다. 나중의 검정 대부분에는 같은 데이터베이스의 더 완전한 내보내기(기록 5,680건, 발견 지점, 층위, 크기, 재질 포함)를 썼다. 그 기호 총계는 확인한 기호들에 대해 Fuls의 Catalog of Indus Signs(2023)에 인쇄된 총계와 거의 일치한다. ICIT 기호는 번호뿐이므로, 데이터베이스 자체의 글꼴로 각 기호를 그려 Parpola의 기술과 맞춰 보는 방식으로 식별했다. 둘째 전사는 Mahadevan의 1977년 용어 색인(텍스트 2,906개)이다. 두 기호 목록은 공유하는 텍스트를 정렬해 연결했다. 991행이며, 기호의 96%가 단일 대응 기호에 대응한다. 첫째 코퍼스에 없는 M77 텍스트 1,664개는 내내 독립된 재현 표본으로 쓰였다.

이 페이지에서 다루는 기호들과 그 ICIT 번호
이 페이지가 다루는 기호들과 그 ICIT 번호, 출현 수: 항아리 740, 물고기 계열(220 단순형, 235 ‘지붕’, 233, 231, 240), 게 798, 무화과 772–786, 무화과 + 게 합자 777, 눈, 이중 곡선, 단지 700, 숫자, 그리고 동판 기호 806 845 61 407 850. 이미지: 여기서 indus-website 글꼴로 그림(ICIT 기호 번호).

02 강연의 주장을 검증하다

모헨조다로에서 나온 막대 인장 M-414의 날인
모헨조다로에서 나온 막대 인장 M-414의 찍힌 모습. 오른쪽에서 왼쪽으로 읽으면 불분명한 교차 기호, 가지에 가로줄이 그어진 U자형 ‘무화과’, 그리고 단순한 ‘물고기’다. 이것이 Parpola의 두 번째 ‘무화과 + 물고기’, vaṭa-mīn ‘북극성’이다. 이미지: Corpus of Indus Seals and Inscriptions, vol. 1 (Joshi and Parpola 1987), p. 100, M-414 a.

03 1994년의 판독과 타밀어 검증

Parpola의 1994년 책은 판독 24개의 표와, 그가 참고한 mīn ‘물고기, 별’로 된 타밀어 복합어 99개의 목록으로 끝난다. 두 코퍼스 모두에서 다음 기호 쌍은 실재하며 되풀이되는 단위다. 3 + 물고기, 6 + 물고기, 눈 + 눈, 화덕 + 고리, 고리 + ‘공간’, ‘공간’ + 물고기. 물고기 + 물고기, 7 + 물고기, 무화과 + 물고기, 무화과 + ‘공간’, 게 + 단순한 물고기는 우연 수준이거나 그 아래다. 책은 물고기 앞의 숫자가 “3, 4, 6, 7로 제한된다”고 말한다. 코퍼스에는 1, 2, 3, 4, 6, 7, 12가 있으며, 타밀어에는 5에 해당하는 별 이름이 있는데도 5는 결코 없다.

모든 판독 뒤에 있는 검증은, 그것이 내놓는 복합어가 실제 타밀어 단어라는 것이다. 우연 기준선을 보면 이것이 얼마나 약한지 드러난다. 미리 정해 둔 그림 개념 98개를 잡자. 그 그림을 뜻하는 어떤 타밀어 단어가 Parpola의 타밀어 별 이름 하나의 첫머리가 되는 경우가 15%이며, 판독들이 쓰는 음성적 허용 범위를 주면 30%다.

04 동판: 기호 = 그림 등식 일곱 개

모헨조다로의 동판은 똑같은 사본들의 세트로 나온다. 각 동판은 한 면에 명문, 다른 면에 동물이나 인물이 있으며, 어떤 세트에서는 같은 명문을 지닌 채 기호 하나가 그림의 자리를 대신한다. Parpola의 46개 세트 유형 분류를 전사들과 맞춰 보면 등식 일곱 개가 나온다:

이것들이 이 문자가 제공하는 가장 확실한 의미다. 그림 기호 749, 341, 753은 동판에만 나오고, 777은 그 밖에 인장 하나에 나온다. 어떤 인장 이름도 이들을 쓰지 않는다. 많은 인장 텍스트를 여는 머리 기호는 동판 텍스트를 여는 일이 결코 없다(198개 중 0). 동판은 인장과 다르게 행동한다. 9절의 포획–재포획 검정에서 동판 텍스트는 작고 닫힌 표지 집합을 이루어 칭호처럼 도시 곳곳에서 되풀이되는 반면, 인장 텍스트는 개별적이다. 동판의 그림은 모헨조다로의 구역별로도 몰려 있다. 텍스트만 있는 동판은 DK-G 남쪽에, 동물 계열은 VS-A에, 인물과 복합 형상은 성채 언덕에 있다.

가장 흔한 동판 명문과 그 출현 수 및 그림
가장 흔한 동판 명문들을 쓰인 그대로(오른쪽에서 왼쪽으로), 사본 수, 읽는 순서, 반대 면의 그림과 함께 보인다. 산토끼, 궁수, 코끼리, 홀로 선 무화과 + 게 합자. 이미지: ICIT 파생 코퍼스로부터 여기서 indus-website 글꼴로 그림.

05 어떤 언어인가? 대조군으로서의 산스크리트어와 수메르어

같은 검증을 산스크리트어(Monier-Williams)와 수메르어(ePSD2 용어집)에도 돌렸다. 그림 하나가 별 이름을 내는 경우는 산스크리트어에서 19%, 수메르어에서 10%로, 타밀어의 15%와 비교된다. 물고기 = 별이라는 말장난도 드라비다어만의 것이 아니다. 수메르어 mul은 ‘별’이면서 물고기이기도 하고, 산스크리트어에는 ṛṣi(물고기의 일종; 큰곰자리의 일곱 현인)가 있다. 그러나 2,895개 언어(CLICS4)에 걸쳐 ‘물고기’와 ‘별’을 뜻하는 일상 단어가 일치하는 것은 세 언어뿐이며, 남아시아에는 없고, 고대 타밀어 mīn이 그중 하나다. 따라서 모든 물고기 판독의 첫 단계는 진정으로 드라비다어에 특징적이다. 그 위에 세운 타밀어 복합어 검증은 그렇지 않지만 말이다. 물고기 앞의 숫자는 타밀어 별 이름을 따르지 않는다. 6 + 물고기, 곧 플레이아데스만 과다하게 나타나며, 5 + 물고기는 결코 나오지 않는다.

06 나머지를 수행한 방법: 검정 전에 등록한 가설

위의 검증 이후의 모든 것은 등록된 예측으로 돌렸다. 각 세트마다 가설과 그 문턱값을 targets/indus/PREDICTIONS.md 에 적어, 어떤 스크립트도 데이터를 보기 전에 저장소에 커밋했다. 그런 다음 검정을 돌리고, 문턱값을 바꾸지 않은 채 결과를 유지 또는 실패로 기록했다. 이렇게 247세트, 가설 2,727건을 돌렸다. 1,425건이 유지되고 1,302건이 실패했다. 세트 176부터는 고정된 진척 지표(targets/indus/PROGRESS.md)에 대해 점수를 매기는 루프로 돌렸다. 검정이 잘못 설정된 것으로 드러났거나 스크립트에 버그가 있었던 곳에서는 기록에 그 사실을 적고 원래 결과 옆에 정정된 결과를 둔다.

수치는 서로 다른 텍스트를 단위로 센다. 같은 인장이 여러 봉인에 찍힌 경우나 똑같은 동판 한 묶음은 한 번으로 센다. 반복된 사본은 어떤 패턴이든 부풀리기 때문이다. 주요 결과는 그것을 찾는 데 쓰지 않은 표본으로 다시 돌렸다. Mahadevan의 M77 추가분, 작은 유적들, 동판을 뺀 더 완전한 코퍼스, Parpola의 CISI 전사다. 읽을 수 있는 두 문자가 대조군으로 쓰였다. 선문자 B(미케네 그리스어, DAMOS 데이터베이스)와 우르 3왕조 시대의 인장 명문(수메르어, ORACC의 날인 22,402개)이다.

07 판독이 들어맞아야 할 문법

08 두 번째 전사, 그리고 다른 이들의 주장

09 어떤 종류의 이름인가?

인장 텍스트는 짧고, 동물 아래에 있으며, 문법적 자리로 끝난다. 그것은 개인 이름인가, 칭호나 직책인가, 신인가? 생태학자들이 겹치는 두 표본으로부터 개체군 크기를 추정할 때 쓰는 포획–재포획 방법은 음가 없이 이 질문을 던질 길을 준다. 모헨조다로 인장의 이름들과 하라파 인장의 이름들을 한 개체군에서 잡은 두 번의 포획으로 보자. 둘 다에 나타나는 이름이 몇 개인지가 전체 개체군이 얼마나 컸는지를 알려 준다.

10 장소와 시기

11 어순이 보여 주는 한에서의 언어

음가가 없으면 언어에 대해 말해 주는 것은 어순과 문법의 모양뿐이다. 네 가지 특징이 한 방향을 가리킨다:

이는 드라비다어와 인도아리아어에 들어맞으며, 핵을 앞에 두는 수메르어와 엘람어에는 불리하다. 두 가지 점이 범위를 더 좁힌다. 어미는 사람을 물고기 이름(Parpola의 별)과 구별하는데, 문다어 문법이라면 그러지 않을 것이다. 그리고 물고기 = 별 단어는 남아시아에서 드라비다어에만 있다. 둘을 합치면 드라비다어 쪽으로 기울지만, 물고기 이름이 별일 때만 그렇다. 그리고 여기서는 어순만으로 드라비다어와 인도아리아어를 가르는 것이 아무것도 없다. 어족별 기대치는 표준적인 유형론이지, 언어마다 확인한 출처가 아니다.

후보 언어들의 이름 목록은 결과 두 가지를 더한다. 우르 3왕조 인장의 수메르어 개인 이름은 첫 요소(Ur-, Lu-, Nin-, 신을 나타내는 기호)가 고정되어 있는 반면, 인더스 이름은 선문자 B와 산스크리트어 이름이 그렇듯 마지막 요소가 고정되어 있다. 이로써 수메르어형 이름 구조가 다시 한 번 배제된다. 드라비다어와 인도아리아어 사이에서는 목록이 결정을 내려 주지 않는다. 인더스 이름의 길이는 산스크리트어 이름에 더 가깝다. 어미 하나의 우세(740이 이름의 82%를 끝맺음)는 고대 타밀어 개인 이름에 더 가까운데, 그 67%가 남성형 -aṉ으로 끝나며, Mahadevan은 740을 이 접미사로 읽는다. 그런데 더 가까운 인도아리아어 비교 대상이 논증을 뒤집었다. Lüders의 초기 브라흐미 명문 목록(1912)은 산치와 바르후트에서 나온, 기원전 200년–기원후 400년경의 프라크리트어 기증자 이름 374개를 준다. 이는 기증된 물건 위의 개인 이름으로, 시기, 장소, 장르에서 인더스 인장에 가깝다. 인더스 이름은 이들과 같은 방식으로 만들어져 있다:

프라크리트어 기증자 이름에도 거의 보편적인 어미가 하나 있는데, 기증 공식의 속격 -sa다. 따라서 740 같은 우세한 어미는 타밀어 -aṉ만큼이나 인도아리아어의 기증자식 공식에도 들어맞는다. 이에 대응하는 드라비다어 검정에는 기증 기록의 타밀어 이름을 썼다. 7세기 이후 DHARMA 타밀어 명문의 영어 번역에서 뽑은 이름 1,396개다. 결과는 증거를 둘로 가른다:

따라서 이름 구조는 수메르어형을 배제하지만 인도아리아어와 드라비다어 사이에서 결정을 내리지는 못한다. 타밀어 기록은 프라크리트어 목록보다 훨씬 늦고, 그 이름의 상당수는 산스크리트어에서 파생된 것이기도 하다.

그래서 Mahadevan의 Early Tamil Epigraphy 쪽 스캔으로부터 같은 시기의 드라비다어 목록을 만들었다. 기원전 2세기경–기원후 4세기의 타밀-브라흐미 동굴 명문에서 나온 기증자 이름 104개다. 이는 시기와 장르에서 프라크리트어 목록과 맞는다.

이 척도들에서 인더스 이름은 같은 시기의 타밀어 이름보다 초기 인도아리아어 기증자 이름을 더 닮은 것으로 보였다. 나중의 대조 실험이 이를 철회시켰다. 유형론적으로 맞춘 미끼를 추가했다. 인더스의 어순 특징을 공유하는 언어인 일본어와 튀르키예어의 이름이다. 남아시아의 두 기증자 목록은 두 미끼를 모두 이겼지만, 그것들은 명문이었고 미끼는 이름 목록이었다. 양쪽의 장르를 맞추자(Monier-Williams의 산스크리트어 이름과 상감 시인들의 이름을 같은 일본어와 튀르키예어 목록과 비교), 데이터의 두 절반 모두에서 일본어가 인더스 이름에 가장 가깝게 나왔다. 앞서의 기울기는 언어가 아니라 장르였다. 이런 종류의 이름 구조 통계로는 언어를 고를 수 없다.

세계 유형론은 범위를 좁혀 주지만 거기까지다. WALS와 Grambank 데이터베이스와 대조해 보면 인더스의 어순 특징은 세계 어속의 81%(Grambank 어족의 68%)를 배제한다. 드라비다어, 인도아리아어, 문다어, 부루샤스키어, 튀르크어, 몽골어, 일본어, 한국어가 모두 남는다. 단 하나의 부류 신호(물고기를 핵으로 하는 이름은 520을 취하고, 사람, 도구, 식물을 핵으로 하는 이름은 740을 취함)는 모헨조다로, 하라파, 다른 유적들에서, 초기와 후기 모두 유지된다. 이는 드라비다어의 인간/비인간 구분에도 들어맞고, 별 이름이 대부분 여성형인 산스크리트어의 성(性) 해석에도 똑같이 들어맞는다.

12 상금에 견주어: 기준점

2025년 1월 타밀나두 주정부는 이 문자를 “고고학 전문가들이 만족할 만큼” 해독하는 사람에게 미화 100만 달러를 내걸었다. 더 이상의 규칙은 공개되지 않았다. 여기서의 작업은 그런 심사단이 그럴듯하게 요구할 기준에 대해, 비중순으로 점수가 매겨졌다(targets/indus/PROGRESS.md, prizebench.py):

첫째와 셋째 단계를 끌어올리려는 시도에서 두 가지 발견이 나왔다. 판의 그림은 단일 기호가 아니라 틀로 되풀이 찍은 텍스트 전체와 짝을 이룬다. 판의 절반에서 확정한 그림 의미는 보지 않은 판 38개 중 1개를 예측한다. 공유되는 두 기호짜리 구절은 약한 경향을 지닌다(각 텍스트를 차례로 빼고 시험했을 때 17%가 맞음, p = 0.05). 대부분 코끼리 구절 706 33 923 740과 나무 구절 806 158이다. 타밀나두의 낙서 표시(Rajan과 Sivanantham 2026, vol. II)를 기호 등식이 필요 없는 검정으로 인더스 행과 비교했다. 두 낙서 요소가 함께 나오는 경우 같은 순서를 유지하는 것은 70.5%로, 인더스 기호의 88.0%와 대비되며, 이 수치는 Keeladi와 Thulukarpatti에서 같다. 기록된 대로라면 낙서 복합체는 인더스 문자보다 덜 질서 정연하다.

같은 루프에서 구조적 추가 사항 두 가지가 나왔다. 수량 바로 앞의 자리는 제한된 집합, 곧 수량에 붙는 표지로 채워지며, 두 코퍼스 모두 그렇다. 그 가장 흔한 기호 열 개가 자리의 52%와 58%를 차지하며, 뒤섞은 행에서는 훨씬 적다. 이는 부분적으로 머리 기호 때문이지만 그것만은 아니다. 그리고 이 규칙을 넣은 문법은 보지 않은 행을 뒤섞은 행보다 조금 더 큰 차이로 더 잘 구문 분석한다.

가장 강력한 보조 결과는 일관성이다. 학습된 부분을 포함한 문법을 한 장소의 행에 맞추고 다른 장소에서 점수를 매기되, 뒤섞은 행 대비 차이로 나타내면:

자형 장치, 수량 표지 자리, 물고기/520 부류 신호는 모두 각 도시에서, 그리고 인장과 판에서 똑같이 행동한다. 우리에 든 기호는 결코 740이나 520을 취하지 않으며, 획이 든 항아리는 행을 끝내는 일이 거의 없다. 하나의 문법 체계가 인더스 세계 전체에 쓰였으므로, 어떤 판독이든 어디서나 이에 들어맞아야 한다. 이름에 접두사가 보이지 않으므로 언어에 접두사가 없어야 한다는 조건을 더하면 유형론의 범위가 더 좁아진다. WALS 어속의 85%와 Grambank 어족의 77%가 배제된다.

이 기준점에 따르면 이기는 것은 이런 것이다. 흔한 기호 70개가량에 값을 주어 대부분의 토큰을 한 언어의 문법적 구절로 읽어 내는 것. 그 뜻은 여러 종류의 외부 증거와 일치해야 한다. 방법은 선문자 B 대조를 통과하고, 값을 정하는 데 쓰인 적 없는 텍스트를 읽어 내야 하며, 그것을 만들지 않은 전문가들에 의해 재현되어야 한다. 현재의 작업은 그런 주장이 통과해야 할 문법과 검정을 제공한다. 판독은 하나도 제공하지 않았다.

13 남은 문제

14 도중에 철회한 것들

예측을 먼저 등록한다는 것은 이 프로젝트 자체의 판독 일부가 나중의 검정으로 뒤집혔다는 뜻이다. 그것들은 기록에 남겨 두었으며, 여기 나열한다:

15 출처

스크립트, 등록된 가설(PREDICTIONS.md), 모든 세트의 결과(results/), 작업 메모(NOTES.md)는 저장소 폴더 targets/indus/에 있다.