- Machine Learning
편집자 주: 이건 Hilary Mason님이 발표했던 프레젠테이션 내용을 옮긴 글이에요. GraphConnect New York, 2018년 10월에 있었죠.
프레젠테이션 요약
세상을 설명하기 위해 사용하는 비유는 기술을 구축하는 방식과 밀접하게 관련되어 있는데, 특히 인공지능과 Machine Learning 분야에서 그렇다는 점이 흥미로워요. 주변에서 개발된 기술 사례를 한번 살펴볼까요? 미국 인구 조사는 열차 차장이 승객 수를 세는 방식에서 아이디어를 얻었다고 해요. 이 간단한 기술이 결국 현대 컴퓨팅의 기초가 되었다니 놀랍죠?
오늘날 AI가 직면한 과제 중 하나는 새로운 기술 역량에 대한 전반적인 이해 부족과 그에 대한 두려움이에요. 매일 뉴스 헤드라인에 등장하는 걸 보면 알 수 있죠. 이 분야 전문가로서 우리가 해야 할 일은 사람들이 AI와 Machine Learning이 실제로 무엇인지 이해하도록 돕는 거라고 생각해요. 어디에서 왔는지, 그리고 이미 일상 생활에서 어떻게 성공적으로 사용되고 있는지 (예: Google 지도, 이미지에 텍스트 할당) 알려주는 거죠. 이 기술이 더 이상 놀랍지도, 두렵지도 않게 느껴질 정도로 우리 삶에 녹아들면 성공이라고 할 수 있을 거예요.
오늘날 AI 및 Machine Learning과 관련된 가장 큰 과제 중 하나는 기술이 우리의 역량을 따라잡을 수 있도록 생각하는 방식을 발전시키는 거라고 생각해요. 미래를 예측할 수 있는 방법론을 생각해내는 것도 중요하죠. 현재 사용 가능한 연구 자료, 경제적 변화(예: 어떤 유형의 기술이 "저렴"해지고 있는지), 기능이 상품화되고 있는지, 새로운 데이터가 제공되는지 등을 확인하기 위한 연구를 꾸준히 수행해야 해요.
이번 프레젠테이션에서는 Natural Language Generation, 실시간 스트림을 위한 확률적 방법, 이미지 분석 및 요약 등 현재 Machine Learning 기술에 대한 개요를 다뤘어요. 이러한 기술을 우리 손끝에 쥐고 있는 것만으로는 충분하지 않겠죠. 우리가 무엇을 개발할 수 있는지와 관계없이, 커뮤니티로서 이러한 새로운 도구를 둘러싼 윤리에 대해 끊임없이 고민하고 그에 따라 행동해야 할 거예요.
전체 발표: 인공지능과 Machine Learning의 현재와 미래
오늘 이야기할 내용은 Machine Learning과 인공지능을 기반으로 구축된 현재와 미래의 기술에 대한 거예요.
그런데 이건 은유에 대한 이야기이기도 해요. 이 프레젠테이션에서 딱 하나만 기억한다면, 문제 정의를 할 때 우리가 사용하는 은유, 그리고 우리가 만들어내는 세상이 우리가 내리는 아키텍처 결정에 어떤 영향을 주는지 생각해보면 좋을 것 같아요. 은유는 우리 알고리즘 설계를 이끌고, 우리가 해결하려는 문제에 대한 창의적인 솔루션을 만들어내죠. 그래서 저는 이 강연 내내 특정 디자인 결정으로 이어진 은유를 강조하고, 상황이 왜 그렇게 흘러갔는지에 대한 맥락을 설명하려고 해요.
은유는 우리가 세상을 바라보는 방식을 좌우하고, 새로운 종류의 솔루션을 만들고 새로운 기회를 열어주는 강력한 도구랍니다.
비유: 인구 조사와 현대 컴퓨팅의 탄생
여러분과 함께 이야기하고 싶은 첫 번째 비유는 바로 인구 조사에 관한 거예요. 아래 사진은 1880년대 기차를 타고 이동하는 사람들의 모습이에요.
제가 왜 이 사진을 보여드리는 걸까요? 바로 이 사진이 아래 시스템을 만들게 된 은유이기 때문이에요.
1880년대에는 기차를 타고 전국을 돌아다니면서 종이에 직접 정보를 기록하는 방식으로 미국 인구 조사를 진행했어요. 당시 기술로는 이 작업을 제대로 수행할 수 없었고, 효율적이지도 않았죠. 허먼 홀러리스라는 뉴욕의 기차 차장이 있었는데, 그는 티켓에 구멍을 뚫는 방식에서 영감을 받아 자동 계산 기계를 만들었고 특허를 받았어요. 이 펀치 카드 디자인은 1930년대에 나온 후기 디자인으로 이어졌고, 이는 오늘날 우리 모두가 컴퓨팅 환경에서 사용하는 아키텍처 은유로 직접 연결되죠. 정말 중요한 비유라고 할 수 있어요.
허먼 홀러리스는 원래 Tablating Machine Company라는 회사를 세웠고, 나중에 IBM으로 이름을 바꿨답니다. 제가 제일 좋아하는 농담이 하나 있는데요. 빈턴 서프라는 분이 "컴퓨터 과학자들이 Kentucky Fried Chicken이라는 이름을 붙였다면 우리는 그걸 Hot Dead Bird라고 불렀을 거다"라고 말한 적이 있어요.
오늘날의 AI 헤드라인
제가 요즘 즐겨보는 AI 관련 헤드라인 몇 가지를 소개해 드릴게요. 이 기사는 Kanye West처럼 랩을 하는 봇을 만든 사람에 대한 이야기예요. 저는 종종 Google 뉴스에 들어가서 "인공 지능"을 검색해서 무슨 일이 일어나고 있는지 확인하곤 해요. 기사의 절반은 "불멸과 우울" 같은 사고방식으로 가득 차 있고, 나머지 절반은 좀 더 긍정적인 태도를 보여주죠. "AI가 암을 치료한다"부터 "AI가 사회를 파괴할 것이다"까지 다양한 메시지가 있어요.
기사 "인공지능은 위험할까? 영국 FEARS 로봇의 절반 이상이 차지할 것"은 어제 Express에 실린 기사인데, 아직 갈 길이 멀다는 걸 보여주죠. 안타깝게도 대화가 제대로 진전되지 않고 있는 것 같아요.
그리고 어떤 기자는 챗봇과 아주 친한 친구가 되려고 하기도 했어요. 녹취록을 보면 그가 "내 이름이 뭐예요?"라고 물어보는데, 챗봇은 "hello, undetermined"라고 대답하죠. 물론 괴짜들은 그 이유를 알겠지만, 일반 사람들에게는 좀 이상하게 보일 수 있어요. 이건 우리가 사용하는 어휘가 기술에 대해 생각하는 방식을 어떻게 바꾸는지 보여주는 좋은 예시라고 생각해요.
우리는 AI와 Machine Learning을 그냥 컴퓨터 프로그램으로 이야기하는 것에서 벗어나, 마법 상자나 갑자기 나타나서 일자리를 빼앗고 Kanye West처럼 랩을 하고 이름을 잊어버리는 생물 같은 존재에 대해 이야기하기 시작했어요.
하지만 저는 이걸 좀 더 현실적으로 바라볼 수 있는 방법을 공유하고 싶어요. 저는 다양한 가능성에 대해 흥미를 느끼면서도, 결국에는 집에 가서 실제로 작동하는 무언가를 만들어야 한다는 점에서 끈질기게 실용적인 사람이랍니다.
결국, 솔루션을 결정하기 전에 우리가 무엇을 하고 싶은지 이야기하기 위한 강력한 은유가 필요하다는 뜻이죠. 그리고 저는 Machine Learning에서 질문을 던지는 게 정말 어려운 일이라는 걸 자주 느껴요. 답이 너무 뻔하거나 아예 불가능한 경우가 많거든요.
AI 기반 구축
이제는 일상적인 용어가 된 빅데이터에 대해 한번 생각해 볼게요. 10년 전에는 모든 데이터를 한 곳에서 확인하고, 그 데이터에 포함된 항목을 계산하는 기능에 초점을 맞춘 빅데이터 이야기를 나눴었죠. 단순해 보이지만, 당시로서는 정말 획기적인 일이었어요.
단순히 이전에는 없던 기능이라서 혁신적인 게 아니었어요. 이전에는 접근조차 할 수 없었고, 엄청나게 비쌌던 것이 저렴하고 접근 가능하게 바뀌었기 때문에 혁신적이었던 거죠. 덕분에 새로운 사용 사례, 새로운 애플리케이션, 그리고 기술에 대한 창의성을 통해 완전히 새로운 작업 영역이 열렸어요.
10년 전 빅데이터 시대가 그랬듯, 오늘날에도 똑같은 일이 벌어지고 있다고 생각해요. 바로 Graph Database죠. 일단 뭔가를 셀 수 있게 되면, 사업 목적으로 그걸 셀 수 있게 되는 거니까요.
분석을 수행할 수 있고, 계산하려는 항목의 종류를 분산시킬 수도 있고요. 또, 해당 기술을 더 많은 사람들의 손에 쥐여줄 수도 있어요. 이유가 있으니까 사물을 셀 수 있는 거겠죠? 그리고 사물을 영리하게 셀 수 있다면, 데이터 과학을 사용해서 사물을 모델링하고, 예측하고, 다양한 은유를 사용해서 데이터 표현을 구축해서 세상을 탐색할 수 있어요. 유용하고 마법처럼 보이는 시스템의 피드백 루프를 통해 사물을 영리하게 계산할 수 있다면, 그게 바로 Machine Learning과 AI인 거예요.
하지만 기술은 단순히 스택 위로 이동하고 있을 뿐이에요.
데이터 과학, 분석, 빅데이터 또는 기본적인 데이터 표현 없이는 Machine Learning을 수행하거나 AI를 만들 수 없어요.
이런 비유를 생각할 때, 저는 AI를 폄하하려는 게 아니에요. 대신, AI를 기능 스택을 위로 올린 결과인 이 기술의 새로운 레이블이라고 생각해주세요. 이전에는 비싸거나 손이 닿지 않았던 것들이 더 다양한 사람들에게 가능해지고, 손에 닿고, 유용해졌다는 거죠. 이것이 오늘날 Machine Learning과 AI에 대한 관심이 그토록 뜨거운 이유예요. 그리고 무엇이 진짜이고 무엇이 아닌지를 사람들이 이해하도록 돕는 건, 기술자인 우리에게 달려있다고 생각해요.
성공적인 AI는 어떤 모습일까요?
구글 지도
그렇다면, 우리가 AI를 잘 활용하면 어떤 모습일까요? 제가 가장 좋아하는 Machine Learning 애플리케이션 중 하나는 교통 상황이 켜진 Google 지도예요.
이 기술의 특별한 점은 정말 '지루하다'는 거예요.
앱은 목적지까지 가는 가장 좋은 경로를 알려주기 때문에, 우리는 그걸 전혀 생각할 필요가 없죠. 이 도구를 지원하는 기술에 대해 조금도 알 필요가 없어요. Android를 실행하는 모든 휴대폰은 Google로 데이터를 다시 전송하고, 과거 및 실시간 데이터를 사용해서 놀라운 예측을 수행해요. 셀룰러 타워 네트워크가 해당 정보를 장치로 스트리밍하기 위해 조정하고 있고, 시각화에 대해 생각할 필요조차 없어요. 우리 사회에서 자란 모든 사람은 녹색은 진행을 의미하고 빨간색은 중지를 의미한다는 것을 인식하도록 훈련받았기 때문이죠. 그냥 보고, 그게 뭘 의미하는지 이해하기만 하면 돼요.
우리는 그걸 Machine Learning 제품이라고 전혀 생각하지 않기 때문에, 성공적인 Machine Learning 제품이라고 할 수 있어요. 우리는 그냥 우리가 가고 있는 곳으로 이동하기 위해 그걸 사용한 다음 꺼버리죠. 이게 바로 성공의 모습이에요. 우리가 AI에 대한 관심을 멈추고, AI 애플리케이션이 우리를 위해 무엇을 할 수 있는지에 대해 흥미를 갖기 시작할 때가 온 거죠. 하지만 여기가 찾기 힘든 곳이기도 해요.
텍스트와 이미지 일치
저는 이 데이터 기반 세계에서 극단적인 사례가 된 간단한 개인적인 예를 하나 공유할게요. 2007년에 'Cuil'이라는 스타트업이 있었어요. 이 회사는 이미지를 웹페이지 결과와 결합해서 Google을 이기려고 했었죠. 당시 Google은 이런 일을 하지 않았기 때문에, 꽤 큰 이슈였어요.
아래는 제 이름으로 검색했을 때 나온 결과예요.
제 이름과 똑같은 철자를 가진 여배우가 있는데, 영화에서 '못생긴 노파' 역할을 맡았대요.
2006년에 데이터 과학 분야에서 최고의 인재를 보유한 Microsoft Bing은 Bing 검색 내에 유명인 시각화 도구를 출시했대요. 다시 말씀드리지만 저는 유명인이 아니에요. 저는 연예인과 이름을 공유하는 너드일 뿐이죠. 하지만 다른 Hilary의 약력을 검색했을 때 나온 내용은 다음과 같았어요.
다시 말하지만, 세계 최고의 인재들 중 일부도 적시에 올바른 데이터를 가져오는 데 어려움을 겪고 있다는 거죠. 이것이 바로 매우 흥미로운 이유이고, 새로운 은유, 데이터를 표현하고 생각하는 새로운 방식이 필요한 이유에요. 우리는 우리의 역량에 맞춰 기술을 생각하는 방식을 기다리고 있는 거예요.
이것이 바로 우리가 지금 이 대화를 나누고 은유, 세상에 대해 생각하는 방식, 구축하려는 아키텍처 간의 상호 작용에 대해 생각해야 하는 이유에요. 이 일을 잘 수행할 수 있는 가장 큰 기회가 바로 여기에 있는 거죠.
제가 가진 장점 중 하나는 흥미로운 Machine Learning 및 AI 애플리케이션을 연구하는 다양한 사람들과 함께 일할 수 있다는 것이에요.
모든 사람들은 멋진 일은 스타트업에서만 일어난다고 생각하지만, 기존 기업은 해당 기업을 장기간 운영하는 데 따른 부작용으로 많은 양의 데이터를 수집해 왔어요. 그들은 개발에 대한 이러한 새로운 은유를 받아들일 준비가 되어 있고 가장 큰 기회를 가질 창의적인 사람들을 보유하고 있죠. 이 사람들은 Fortune 100대 기업에 속할 수도 있고 정말 흥미로운 과제를 해결하는 연구자일 수도 있어요. 여러분에게는 큰 기회가 있는 거예요.
Machine Learning: 미래를 보는 방법
Machine Learning 분야에 종사한다면 예측이 어렵고 미래를 예측하는 것이 더욱 어렵다는 것을 알고 계실 거예요. 저는 응용 Machine Learning 연구 그룹이 미래를 보기 위해 거치는 과정을 검토할 거예요. 여러분도 우리의 방법론을 자신의 작업에 적용할 수 있기를 바라요.
At 패스트 포워드 랩, 현재 Cloudera의 일부가 된 곳인데, 실제 비즈니스 사용 사례를 위해 설계된 새로운 Machine Learning 애플리케이션에 대한 분기별 보고서를 작성하고 있어요. 우리 팀은 사람들이 현실 세계에서 기록하는 데이터로 가득 찬 30개의 논문을 읽고, 규모에 따라 무엇이 효과가 있을지 알아내기 위해 코드를 작성하죠.
우리의 목표는 고객이 이러한 기술을 활용할 수 있는 속도를 가속화하는 최고의 친구가 되는 것이에요. 그러기 위해서는 앞으로 무엇이 나올지 살펴보고 현재 생산 중인 것보다 6개월에서 2년 앞선 것을 목표로 삼아야 하죠.
우리의 비밀은 다음과 같아요. 커피를 마시고 아이디어를 가지세요. 심지어 나쁜 아이디어도 괜찮아요. 여기서 제가 지적하고 싶은 것은 아이디어가 많아야 하고, 이는 의도적으로 나쁜 아이디어를 가지려고 노력한다는 거예요.
어떤 회사를 방문했을 때 그들이 진행하고 있는 Machine Learning 프로젝트를 보여줬는데 다 좋은 아이디어였을 때 걱정이 많이 됐어요. 확실히 좋은 아이디어만 추구한다면 약간 위험할 수도 있지만 엄청난 잠재적 보상을 얻을 수 있는 많은 기회를 놓치게 되는 거죠.
따라서 많은 아이디어를 얻은 다음 검증하세요. 최대한 광범위하게 진행한 다음 해당 컬렉션이 있으면 정량적일 수 있는 강력한 기준에 따라 검증하는 거예요.
우리가 사용하는 기준은 다음과 같아요.
연구 활동
특정 Machine Learning 애플리케이션과 관련된 활발한 연구 활동을 찾아보세요. 사람들이 관련 논문을 출판하고 있나요? 한 학술 분야에 다른 분야로 이동할 수 있는 논문이 있나요? 우리 팀과 같은 팀의 장점 중 하나는 컴퓨터 과학자, 물리학자, 신경과학자, 전기 엔지니어 등 다양한 배경을 가진 사람들이 있다는 것이에요. 한 분야의 문제를 해결했지만 다른 사람에게 굳이 알리지 않는 사람들이 있죠. 하지만 한 방에서 이렇게 다양한 사고를 하게 되면 한 영역에서 다른 영역으로 이동할 수 있는 많은 창의성과 잠재적인 지식을 얻게 되는 거예요.
경제학의 변화
솔루션을 설계하는 데 시스템에 필요한 경제성에 변화가 있나요? 즉, GPU 또는 CPU 컴퓨터의 가격은 얼마인가요? 우리가 사용하는 거의 모든 시스템에 대해 이와 동일한 그래프를 그릴 수 있지만, 제가 찾은 매우 설득력 있는 특별한 예는 마이크로 SD 카드에요.
그 용량은 지난 10년 동안 엄청나게 증가했어요. 동일한 가격, 동일한 카드, 동일한 폼 팩터인데 말이죠. 지금은 손에 닿지 않는 물건이라도 1년 뒤에는 값이 싸질 수 있으니 버리지 마세요. 이걸 활용할 수 있는 서비스가 분명 있을 거예요.
상품화되는 기능
우리는 특히 오픈 소스 라이브러리에서 상품화되는 기능을 찾고 있어요. Hadoop 자체가 사람들이 어떻게 하는지 알고 있음에도 불구하고 하기가 매우 어렵고 비용이 많이 드는 일의 핵심 예시죠.
오픈 소스 프로젝트가 꽤 널리 채택되면 해당 인프라를 한 곳에 두고, 개수를 계산하고, 상당히 쉽게 답변을 얻을 수 있다는 것을 당연하게 여길 수 있어요. Word2vec은 Machine Learning 공간의 또 다른 훌륭한 예시고요. 단어 임베딩은 수학적으로 매우 복잡하죠. 자신만의 글을 쓰려면 상당한 시간과 에너지를 투자해야 해요. 하지만 이제는 다운로드해서 몇 시간 만에 실행할 수 있다니, 정말 놀랍죠?
상품화는 계속 움직이는 물결과 같고 Machine Learning 실행 능력에 매우 강력한 영향을 줘요.
새로운 데이터 이용 가능
마지막으로 찾아야 할 것은 내부적으로든 외부적으로든 새로운 데이터를 사용할 수 있게 되는 거예요. 새로운 제품이나 기능을 출시해서 생성되는 데이터일 수도 있고, 전 세계에서 수집하거나 구매할 수 있는 데이터일 수도 있죠. 하지만 데이터의 출처가 무엇이든 Machine Learning을 추구하려면 데이터를 사용할 수 있어야 해요.
제가 두 가지 이유로 데이터 과학에 관한 Wikipedia 페이지를 열었어요.
첫 번째는 Wikipedia가 스타트업이 운영하는 모든 MLP 애플리케이션의 더러운 비밀이라는 점이에요. 정보는 널리 이용 가능하고 상업적 목적으로 라이선스가 부여되기 때문이죠.
두 번째 이유는 오랫동안 Wikipedia 데이터 과학 페이지가 이 페이지의 생성을 직업으로서의 데이터 과학 발전의 주요 이정표로 인용했기 때문이에요. 그건 제가 본 것 중 가장 위키피디아에 관한 것이죠.
기준이 정해지면 일련의 아이디어를 검토하고 가능성이 있는 것과 그렇지 않은 것을 제쳐두세요.이러한 위험한 기능을 점진적으로 탐색할 수 있어요.
우리 그룹에서는 아이디어를 더 탐구해야 할지 여부를 결정하기 위해 인터넷 검색과 출판된 논문의 초록 읽기로 구성된 3시간의 조명 검토를 수행해요. 다음으로, 우리는 읽을 논문의 하위 집합을 선택하고 그것이 투자할 가치가 있는지 여부에 대한 개별적인 관점에 도달하죠. 그런 다음 이전 필터를 통과한 논문의 하위 집합을 가져와서 코드를 작성해요.
투자할 시간의 범위를 제한함으로써 이 점진적인 탐색을 통해 시간을 투자할 가치가 없을 수도 있는 위험한 아이디어를 고려할 수 있어요. 또한 작업하는 사람의 수에 관계없이 동일한 답변을 반복적으로 얻는 데 도움이 되고요.
이제 미래를 예측하는 것이 실제로 어렵다는 것을 보여주기 위해 아래에는 2000년의 삶을 예측하는 1900년경 프랑스의 엽서가 있어요.
중앙 엽서에는 컬렌더를 머리에 쓰고 교실에 있는 아이들이 지식을 뇌에 직접 펌핑하고 있어요. 오른쪽에는 불을 끄기 위해 날개를 달고 날아다니는 소방관들이 있네요. 그리고 이러한 문제 중 일부를 해결할 수 있는 기술이 있음에도 불구하고, 이러한 기술은 1900년대 사람들이 상상조차 할 수 없었던 방식으로 구현되었죠.
정확한 예측을 하는 건 정말 어려운 일이에요. 그래서 예측이 올바른 방향이라면 꽤 잘하고 있는 거라고 생각해요.
기술 심층 분석
이제 현재 존재하는 실제 Machine Learning 기술과 가까운 미래에 등장할 기술에 대해 자세히 살펴볼게요. 이러한 도구는 모두 위에 설명된 프로세스에서 나왔어요. 미래를 보는 방법을 알고 계신다면, 우리가 거기에서 무엇을 보는지 말씀드릴게요.
Natural Language Generation
우리 보고서 중 하나는 Natural Language Generation에 관한 것이에요. 뉴스에서 본 적이 있을 텐데요. 는 Associated Press에서 나온 기사인데, AP의 언론인들은 이제 자신의 기사를 쓰고 있다고 해요. 실제로 이러한 알고리즘을 감독하는 자동화 편집기가 있죠. 그는 이야기를 생성하는 소프트웨어 시스템을 감독하지만 사람은 감독하지 않아요.
우리는 부동산 광고를 생성하는 프로토타입을 만들었어요. 구매 또는 판매하려는 아파트의 특성을 입력하면 도구가 광고를 작성해주는 거죠. 하지만 존재하지 않는 것을 말하면 정말 이상해져요.
예를 들어, 도어맨이 있는 어퍼 이스트 지역의 침실 1개, 욕실 16개 아파트를 판매하려는 경우 "햇빛이 가득한 집에는 욕실이 많습니다."와 같은 결과가 반환될 거예요. 제 말은 로봇이 기사를 쓴다는 것이 아니라, 인간으로서 우리가 데이터와 상호 작용하는 방식을 보여준다는 거예요. 데이터 열이나 데이터 그래프에서 이 모든 언어를 상상할 수 있죠.
중간에 그래프가 있는 것을 상상할 수 있고, 모든 전문가가 그래프와 Excel을 읽을 수 있을 거라고 기대할 수 있겠죠. 하지만 대부분의 사람들은 해당 데이터에 대한 언어 기반 해석을 직관적으로 이해하는데, 이것이 바로 이 기술이 우리에게 제공하는 것이에요. 구조화된 데이터에서 데이터가 말하는 내용을 설명하는 몇 개의 문장 형태로 해당 데이터의 언어 기반 표현으로 이동할 수 있는 거죠. 진정한 힘은 언어의 힘을 통해 구조화된 데이터에 대한 이해를 훨씬 더 많은 청중에게 전달하는 데 있어요.
우리는 두 명의 고객에 대해 이것이 구현되는 것을 보았어요.
첫 번째는 이 기술을 사용하여 규정 준수 서류를 자동으로 생성하는 은행이에요. 그 뒤에는 정말 흥미로운 이야기가 숨어있죠. 두 번째는 유명인 의류의 구조화된 JSON 피드를 사용하여, 예를 들어 Kim Kardashian이 구매할 수 있는 특정 스웨터를 입고 있다는 텍스트를 생성하는 모바일 앱을 만드는 유명인 패션 잡지예요.
두 도구 모두 수학적으로는 동일하지만 형태는 매우 다르죠. 다시 한 번 은유가 여기에 있는 거예요.
실시간 스트림에 대한 확률적 방법
우리는 세상을 실시간으로 이해하는 데 필요한 새로운 아키텍처가 있다고 생각해요.
이를 엔지니어링 관점에서 생각하면, 예를 들어 데이터를 배치 환경에 보관하고 평균을 생성하는 비유에서 벗어나게 돼요. 매우 간단하지만 데이터 세트의 규모나 분산 정도에 따라 실제로 계산하는 데 꽤 오랜 시간이 걸릴 수 있죠.
하지만 컴퓨팅 장치가 내 썸네일 크기만 하고 메모리가 매우 제한되어 있고, 초당 수천 개의 이벤트가 들어오는 데이터 스트림이 있는 세상에 살고 있다면 어떻게 될까요? 해당 환경에서 평균을 어떻게 계산할까요?
여기서 대답은 저장소 샘플링이라는 알고리즘을 사용하는 것이에요. 필요한 컴퓨팅 양과 메모리 양이 제한되어 있고, 항상 확률적으로 업데이트되는 특정 양의 버킷이 있으며, 언제든지 평균을 구할 수 있죠. N개 버킷의 평균을 구하기 때문이에요. 이제 정답 대신 오류 막대가 있는 정답이 표시되는 거죠.
이것은 우리가 아직 완성하지 못한 Star Trek 트라이코더를 마침내 구축할 방식이라고 제가 상상하고 싶은 시스템 설계에 대한 생각을 비유한 것이에요. 대신, 다음은 하나의 작은 EC2 인스턴스를 사용하여 Reddit의 전체 댓글 모음에서 이를 실행하는 데모예요.
"샤워할 때 떠오르는 생각"과 "내가 솔로인 이유" 사이에 사용된 언어의 유사성이 보이는 것 같아요. 사람들은 인터넷 구석구석에서 비슷한 이야기를 나누고 있다는 거죠.
이것이 바로 우리가 아키텍처 디자인의 오래된 비유에 갇혀 있었다면 불가능했을 시스템을 구축할 수 있게 해준 그래프 비유랍니다. 커뮤니티로서 우리가 이제 막 활용하기 시작한 이러한 확률적 기술에는 엄청난 힘이 있는 것 같아요.
Deep Learning: 이미지 분석
물론, AI와 Machine Learning을 이야기하면서 Deep Learning을 빼놓을 순 없죠! Deep Learning은 뉴런을 가진 Neural Network의 진화된 형태라고 할 수 있어요.
이 뉴럴 네트워크들은 여러 개가 함께, 그리고 레이어 형태로 구성돼요. 여기서 "Deep"은 레이어의 수를 의미하는데, 사실 엄밀한 기술 용어는 아니랍니다. 왜냐하면 레이어가 단 하나인 Deep Network만 포함하는 Deep Learning 논문도 많이 봤거든요.
이 Neural Network는 1940년대와 50년대에 뇌가 작동한다고 생각했던 방식에서 영감을 받았어요. 실제로 최초의 Neural Network는 코넬항공연구소에서 조명이 켜지고 꺼지는 것을 인식할 수 있는 하드웨어 형태로 개발되었죠.
오늘날에는 이전에는 상상도 못 했던 리치 미디어 분석이 가능해졌어요. 예를 들어, '이 사람은 아일랜드 사진 찍는 것을 좋아합니다'라고 알려주는 Instagram 필터를 사용할 수 있는 데모도 있답니다.
Machine Learning 개발자이자 과학자로서, 우리는 이러한 기술의 한계를 보여줄 책임이 있기 때문에, 이 기술이 어떻게 잘못될 수 있는지 한번 살펴볼게요. 저는 치즈버거를 좋아해서 뉴욕의 치즈버거 맛집인 Bleecker Burger의 예를 들어보겠습니다.
꽤 잘 분류했네요. 왼쪽 상단에는 이것이 버거라는 것을 알려주고요. 맨 아래에 있는 것은 음식이라고 되어 있지만, 미트 로프일 수도 있고 핫도그일 수도 있대요. 우리는 완전히 확신할 수 없죠. 그리고 버거가 아닌 깃발이 유일하게 있고, 게도 있네요!
그럼 게는 뭘까요? 이걸 보면 이 Neural Network가 물이나 부두 근처에서 감자튀김처럼 보이는 것은 게라고 학습했다는 것을 알 수 있어요.
다시 한번 강조하지만, 이러한 기술과 은유의 힘을 이해하는 것, 그리고 때로는 약간 이상하게 변하는 것을 인지하는 건 우리 모두의 책임이에요. 우리 개개인이 기술이 이상하게 흘러가지 않도록 신경 써야 하는 거죠.
요약
단어 임베딩 및 문장 임베딩 같은 도구를 사용해서 이와 동일한 종류의 Deep Learning을 텍스트에 적용하면, 기사를 가져와서 동일한 정보를 담고 있는 문장을 추출하는 시스템 같은 걸 구축할 수 있어요.
이 작업은 모두 자동으로 수행되고, 모델이 훈련된 방식 덕분에 영어로 된 모든 기사에 적용할 수 있다는 장점이 있어요. 물론 다른 언어에서도 쉽게 개발할 수 있고요.
이런 종류의 도구는 단순히 텍스트 한 조각만 보는 게 아니라, 동일한 주제에 대한 50,000개의 문서로 구성된 콘텐츠 모음을 보고 다양한 관점을 추출하는 새로운 방법을 제시하죠. 클러스터링하고, 해당 코퍼스에서 관점을 찾고, 각 관점을 요약함으로써 가능한 일이에요. 이제는 꽤 쉽게 할 수 있는 일이 되었답니다.
마지막으로 알고리즘 해석 가능성과 관련된 내용이에요. 이 블랙박스 모델을 모두 조립했을 때 내부는 어떻게 생겼을까요? 그리고 왜 내부를 들여다봐야 할까요?
첫 번째 이유는 정부 규제 때문이에요. 규정 준수를 위해서는 시스템이 왜 그런 결정을 내렸는지 설명할 수 있어야 하는 경우가 많거든요. 금융이나 의료 분야에 종사하지 않아서 이 글을 그냥 넘기셨던 분들을 위해 두 번째 이유를 설명해 드릴게요. 때로는 이런 시스템이 정말 이상한 일을 할 때가 있는데, 여러분은 그 이유를 알고 싶어하잖아요. 이유를 알면 전반적으로 더 나은 시스템을 구축할 수 있게 되죠.
블랙박스 알고리즘 위에 얹어서 입력에 스며들게 한 다음, 출력과 분류가 어떻게 변하는지 살펴보는 알고리즘 세트가 있어요. 그 후에 블랙박스 모델에서 어떤 특징이 중요했는지 추론하는 거죠. 약간의 직관을 얻을 수 있겠죠?
예를 들어 통신 이탈 분석을 통해 고객이 이탈할 가능성뿐만 아니라, 이탈 이유와 취할 수 있는 조치까지 파악할 수 있어요.
작업을 수행하고, 해당 분류와 그에 따른 고객의 운명을 바꾸기 위해 변경되는 확률을 확인할 수 있다는 점도 매력적이죠.
이것이 바로 규정 준수 및 규제 사용 사례 외에도 매우 유용한 기술이라는 점이에요.
결론
제가 가장 좋아하는 그래프 기반의 Machine Learning 예시로 마무리할게요. 다음 기사는 길라드 로탄의 글에서 가져왔는데요, 그는 대통령 취임 후 Buzzfeed의 수석 데이터 과학자가 되었어요.
그는 소셜 미디어에서 이모티콘 사용에 대한 대규모 분석을 수행했고, 아래 그림처럼 취임식에 기뻐하는 사람들과 그렇지 않은 사람들로 나뉘어 표현했죠.
이 그래프 시각화에서 데이터들이 클러스터링되는 모습은 사람들의 이야기를 담고 있어요. 미국 국민들에게 특별하고 감정적인 순간을 분석하는 데 적합한 은유라고 할 수 있죠.
또 다른 프로젝트는 세계 최고의 회계 법인 중 하나가 세법 관련 자동화를 파악하도록 돕는 일이었어요. 미국의 세법은 새로운 법률과 기존 법률에 대한 사법적 해석의 변화를 통해 지역, 주 차원에서 매우 복잡하게 바뀌는데, 우리는 그 변화를 이해하고 싶었죠.
그래서 그들이 놓치는 부분이 없도록 워크플로우에서 CPA를 지원하는 Machine Learning 도구를 자동으로 구축하는 데 도움이 되는 모델을 만들 수 있었답니다.
우리는 또한 원자재 거래 방식에 대한 유사한 분석을 생성할 수 있었어요. 들어오는 뉴스는 여러분의 투자 포트폴리오에 영향을 미치고, 이러한 연결을 볼 수 있어야 하죠.
이것은 정확한 순간에 올바른 정보를 제공함으로써 인간 전문가의 업무 수행 능력을 더욱 향상시키는 도구를 구축하기 위해 해당 은유의 힘을 사용하는 예시랍니다.
이 일을 하려고 달려가는 분들을 위해 몇 가지 주의 사항으로 마무리할게요. 어렵다는 거예요. 우리는 아직 우리가 무엇을 하고 있는지 완전히 알지 못해요. 모범 사례들이 계속 등장하고 있죠. 그리고 기술을 사용하여 무언가를 만들고 있다면, 자신이 만든 것이 우리가 살고 있는 세상에 미치는 영향에 대해 깊이 생각해 보시길 바라요.
저는 “윤리와 데이터 과학”이라는 책을 DJ 및 Mike Loukides와 함께 공동 집필했어요. 이 책은 윤리 및 데이터 과학의 실천에 대해 이야기하고, 질문을 던지기는 하지만 모든 답을 제공하지는 않아요.
저는 이것이 데이터 과학 실무자들이 우리 시대에 대해 생각하고 있는 큰 질문이라고 생각해요. 이러한 기술을 구축할 때 이 점을 꼭 생각해 주세요.
제가 가장 좋아하는 비유는 특히 기술과 Machine Learning이 우리에게 초능력을 준다는 거예요. 꾸밈없는 인간으로서는 상상도 못 할 일들을 가능하게 해주니까요. 이 분야에서 일하는 건 정말 흥미로운 경험이죠.
- AI 윤리
- AI 기술
- Machine Learning
에이치시스템즈의 LogTree는 Neo4j 기반 GraphRAG 플랫폼으로, 데이터를 자동으로 지식그래프화하고 자연어 질의로 즉시 답을 제공합니다.
'GraphRAG' 카테고리의 다른 글
| GraphQL API에 Retrieval-Augmented Generation (RAG)을 더하는 방법 (0) | 2026.05.31 |
|---|---|
| LlamaIndex에서 Property Graph Index를 내 입맛대로 커스터마이징하기 (0) | 2026.05.29 |
| Neo4j 대규모 지식 그래프에서 예측 분석: GraphRAG와 Machine Learning 활용 (1) | 2026.05.28 |
| 2023년 그래프 기술 전망: Neo4j와 GraphRAG의 미래는? (1) | 2026.05.28 |
| Precise Economic Policy in a World of Chaos (0) | 2026.05.28 |
