LUCEO 서재책 한 권을, 끝까지 함께 읽습니다

컴퓨터가 없앤 것은 주관이 아니라, 주관이 여럿이라는 사실이었습니다

"컴퓨터 프로그램은 주관적 해석을 허용하지 않는다"

어두운 1990년대 사무실. 큰 모니터 하나를 두 분석가가 양쪽에서 들여다보고 있다
흔들리지 않는다는 것과 옳다는 것은 다른 말입니다.

같은 차트를 두 사람이 나란히 놓고 봅니다. 한 사람은 여기서 힘이 실렸다고 하고, 다른 사람은 아직 모르겠다고 해요. 화면은 하나인데 판정이 둘입니다.

하루의 값을 그리는 방식 중에 캔들차트라는 것이 있습니다. 장이 열릴 때와 닫힐 때의 값을 몸통으로 그리고, 그날 값이 닿았던 위아래 끝을 가는 선으로 뽑아 놓는 방식이에요. 그래서 화면을 열면 그날 어느 쪽이 이겼는지가 몸통의 색과 길이로 한눈에 들어옵니다.

그런데 그 길이를 읽는 것은 사람입니다. 몸통이 얼마나 길어야 긴 몸통인지, 위로 뻗은 선이 어느 정도여야 길다고 할 것인지는 화면에 적혀 있지 않아요.

그 세부가 주관적이라는 것을 스스로 인정한 책이 있습니다. 존 J. 머피가 1999년에 낸 개정판 《금융시장의 기술적 분석》인데, 차트 읽는 법 열아홉 장을 정리해 놓고 곧바로 단서를 하나 답니다.

"이 세부들은 캔들차트를 눈으로 볼 때는 주관적이지만, 컴퓨터 프로그램으로 패턴을 자동 식별할 때는 그렇지 않다. 컴퓨터 프로그램은 명시적인 지시를 요구하며, 주관적 해석을 허용하지 않기 때문이다." (12장)

장점으로 적힌 문장입니다. 사람이 흔들리는 자리를 기계가 붙잡아 준다는 뜻이니까요.

누군가는 그 길이를 숫자로 정해야 합니다

프로그램이 명시적인 지시를 요구한다는 말은, 프로그램을 만드는 자리에 앉은 사람이 「몸통이 이만큼보다 길면 긴 것으로 친다」를 먼저 정해 놓아야 한다는 뜻입니다.

그 사람도 화면에 적혀 있지 않은 것을 정합니다. 근거가 있을 수도 있고, 오래 보다 보니 그쯤이 맞겠다 싶었을 수도 있어요. 어느 쪽이든 그것은 판단입니다.

그 판단이 코드가 되는 순간 성질이 바뀝니다. 어제와 오늘이 같아지고, 이 사람과 저 사람이 같아지고, 다시 물어지지 않아요. 흔들리지 않는다는 것과 옳다는 것은 다른 말인데, 화면 앞에서는 그 둘이 잘 구별되지 않습니다.

그러니까 없어진 것은 주관이 아닙니다. 없어진 것은 주관이 여럿이라는 사실이에요. 판정은 그대로 남아 있고, 다만 한 사람의 것이 모두의 것이 됐습니다.

누구의 판단이 코드가 됐는지는 대개 어디에도 적혀 있지 않습니다.

이 그림은 언제부터 있었는가

몸통과 선으로 하루를 그리는 이 방식은 일본에서 왔습니다. 일본인들이 몇 세기 동안 써 왔고 서양에서 널리 쓰이게 된 것은 최근 몇 해뿐이라고 12장에 적혀 있어요. 1999년에 쓰인 「최근 몇 해」입니다. 몇백 년을 사람 눈이 읽던 그림인데, 그것이 코드로 옮겨진 것은 그러니까 아주 최근이에요.

더 빠른 것과 더 권위 있는 것

컴퓨터가 무엇을 해 주는지를 세 낱말로 적어 둔 자리가 있습니다.

"차트를 하나하나 살펴보면 같은 정보를 찾을 수 있다. 컴퓨터는 그 일을 더 빠르고, 더 쉽고, 더 권위 있게 만들 뿐이다." (15장)

앞의 둘은 품이 얼마나 드느냐의 문제입니다. 사람이 사흘 걸려 하던 일을 한 번에 해내고, 손도 훨씬 덜 갑니다.

셋째는 종류가 다릅니다. 권위는 빨라진다고 생기는 것도, 손이 덜 간다고 생기는 것도 아니니까요. 같은 판정을 사람이 눈으로 내리면 의견이 되고, 화면이 선으로 그려 주면 결과처럼 보입니다. 판정의 내용은 그대로인데, 그것이 놓인 자리가 달라진 겁니다.

그 장을 여는 첫 문단에는 물음이 하나 있습니다.

"차트 패키지는 기술적 분석을 하는 사람이 쓸 수 있는 80가지 분석 도구를 제공한다. 그렇게 많은 데이터를 상대하면서 어떻게 어떤 결론에 이를 수 있단 말인가?" (15장)

좋은 물음인데 답은 나오지 않습니다. 대신 처방이 옵니다. 기본 도구를 먼저 쓰고, 여러 개 가운데 가장 편한 하나나 둘을 골라 그것으로 가라는 것.

고르는 기준이 「편한 것」입니다. 여든 가지 중 어느 것이 지금 이 시장에서 통하는지는 여전히 아무도 가려 주지 않고요.

가리는 일을 실제로 해 보는 방법이 없지는 않습니다. 규칙의 설정을 이리저리 바꿔 가며 지난 자료에 걸어 보고 성적이 가장 좋았던 조합을 남기는 것 — 최적화라고 부릅니다. 그러면 그 규칙의 성적표는 찾아낸 것이 아니라 고른 것이 되죠. 저자는 다른 장에서 그 방법을 이렇게 정리해 둡니다.

"그러나 대부분의 증거는 최적화가 일부가 생각하는 성배가 아님을 시사한다." (9장)

여기까지가 책에 적혀 있는 전부이고, 최적화가 무엇인지에 대한 답은 이 책 밖에 있었습니다.

네 사람이 그 성적표를 거꾸로 계산해 봤습니다

2014년, 미국수학회가 내는 회보에 네 사람이 쓴 논문이 실립니다.

이들이 던진 물음은 이랬어요. 지난 자료에 규칙을 여러 개 걸어 보고 그중 성적이 가장 좋은 것을 골랐을 때, 그 성적표는 무엇을 뜻하는가.

계산해 보니 이렇습니다. 실력이 전혀 없는 규칙만 가지고도 — 그러니까 앞으로 벌어 줄 몫이 하나도 없는 규칙만 늘어놓고도 — 자료가 5년치라면 서로 다른 설정을 마흔다섯 가지만 시험하면 됩니다. 그중 성적이 가장 좋은 하나는 위험까지 감안해도 훌륭하다는 평가를 받을 점수를 지난 자료에서 냅니다. 거의 언제나요.

자료가 2년치라면 일곱 가지면 됩니다. 자료가 짧을수록 우연히 잘 맞는 구간을 만나기 쉬워서, 필요한 횟수가 그만큼 줄어듭니다.

그렇게 고른 규칙이 앞으로 낼 성과의 기댓값은 0입니다.

이 계산에는 단서가 붙어 있습니다. 마흔다섯도 일곱도 서로 독립적인 시험을 셌을 때의 숫자예요. 비슷한 규칙끼리는 독립이 아니어서 실제로 유효한 횟수는 그보다 적습니다. 마흔다섯 번을 넘겼으니 가짜라는 식으로 읽을 수 있는 숫자가 아니라는 뜻이죠.

이 연구가 이 책과 같지 않은 지점도 분명합니다. 저쪽은 시험을 몇 번 했는지 세어 가며 하는 자리이고, 화면 앞에서 설정을 몇 번 바꿔 본 사람은 그 횟수를 세지 않아요. 다만 세지 않았다고 해서 그 횟수가 0이 되지는 않습니다.

논문이 마지막에 내놓은 요구가 숫자 하나를 적어 두라는 것이었던 이유가 여기 있습니다. 몇 번 시험했는지가 적혀 있지 않은 성적표는 좋든 나쁘든 판단할 수 없다는 것.

1986년, 컴퓨터 값만 5,000달러

1980년대 중반의 베이지색 데스크톱 컴퓨터가 사무실 책상 위에 홀로 놓여 있다
지금 켜 놓은 그 화면은 한때 5,000달러짜리였습니다.

이 책 초판이 나온 1986년, 진지하게 기술적 분석을 하려면 하드웨어에 약 5,000달러가 들었다고 저자는 적습니다. 소프트웨어는 2,000달러에 가까웠고요. 1999년 개정판에는 그 값이 어떻게 됐는지가 나란히 적혀 있습니다. 컴퓨터는 2,000달러가 안 되고, 소프트웨어는 대부분 300달러 아래라고요.

그 뒤로 스물일곱 해가 더 지났습니다.

값이 내려가면 같은 도구를 쓰는 사람이 늘어납니다. 그리고 누군가 한 번 정해 둔 그 몸통 길이 기준은, 도구를 여는 사람 수만큼 화면에 그대로 복제됩니다.

판정이 하나로 줄어든 상태를 흔히 객관이라고 부릅니다. 남은 그 하나도 여전히 누군가의 판정입니다.

어떤 규칙의 지난 성적표를 볼 일이 생기면 점수보다 먼저 볼 자리가 있습니다. 그 점수가 몇 개 중에서 고른 것인지요. 대개 적혀 있지 않습니다.

이 책은 열여섯 번째 장에서 어느 도구를 고르느냐보다 먼저 정해야 하는 것을 꺼냅니다 — 한 번에 얼마를 걸 것인가.


고지: 2026년 9월 집필 · 인용은 1999년 개정판 기준 · 구체적인 지표 설정값과 판정 기준값, 계산 절차는 원서에 있습니다 · 투자 권유가 아닙니다 출처: 존 J. 머피 《금융시장의 기술적 분석》 1999 개정판 9·12·15장 / David H. Bailey · Jonathan M. Borwein · Marcos López de Prado · Qiji Jim Zhu, "Pseudo-Mathematics and Financial Charlatanism: The Effects of Backtest Overfitting on Out-of-Sample Performance", Notices of the American Mathematical Society 61(5), 458–471 (2014)