[좋강] Jev의 개발 배경
https://www.youtube.com/watch?v=cJ0EOzey--o
개요
요즘 Jev라는 녀석이 또 AI씬에서 화재이다. 처음엔 '이번엔 또 뭐냐...' 싶었지만 특이하기도 하고 쓸모있어보이기도 하고 기존의 패러다임(?)과는 조금 다른 녀석이기도 하다.
동영상을 보면 알겠지만 실제로는 목적 자체가 다른 LLM모델들과 다른 녀석이다.
Jev는 간단히 말하면 TypeSafe에서 개발한 모델인데, 기존 LLM들과 차이가 있다면 출력이 선택지 중 1개와 그 확률을 명시하는 방식이라는거다.

그러니까 위와 같은 인풋이 있고, 선택지 셋이 {자동차,인형,블록}이라면 {자동차,0.96}을 출력한다는 얘기이다.
최대 몇백 배 빠르고 저렴하다고 주장한다. (실측으로는 5~10배정도까지로도 나오는듯)
딱 봐도 그래프랑 아주 시너지가 좋을 것 같기도 하고 Langchain에서도 벌써 관련 튜토리얼이 나오고 있다.
이녀석에 대해 조사해보니, 실제로 투자를 많이 받아 만든 모델이기도 한데... 대체 왜 만들었을까? 라는 의문이 들어 찾아보니 마침 제작자가 한 강의가 있어 살펴봤다. (맨 위의 동영상을 보면 된다.)
AI가 잘하는 것 vs 못 하는 것

AI는 연구도 잘하고, 수학 난제도 풀고, 코딩도 잘하고, 그림도 잘 그리고, 동영상도 잘 만든다.
반면 QA, CS, 드라이브쓰루 이런 건 아주 잼병이다.
그렇다면 이 둘을 나누는 기준이 뭘까?

발표자는 잘 하는 것은 "인간을 보조하는 것"이고 못 하는 것은 "자동화"라고 한다.
그럼 왜? (RLHF)
그럼 왜인가?
RLHF(Reinforcement Learning from Human Feedback)에대해서 먼저 알아보자.
RLHF는 일종의 모델 학습법인데, 오늘날 거의 모든 LLM의 기반이 되는 알고리즘이며, 발표 시점에서 100%의 모델들이 이런 방식으로 학습했다.
이 방식은 사람이 '이 답이 더 좋다'라고 평가한 데이터를 이용해서, LLM이 사람 선호에 더 맞게 답하도록 학습하는 것이다.
다시 말하면, 사용자(인간)이 만족할 만한 대답을 내놓는 것이 이 학습의 목적인 셈이다.
그래서 괴리가 발생하는데, 사용자는 만족하지만 결과는 그렇지 않을 수 있다는 것이다.

가령 위 사진같은 사례만 봐도, 사용자에게는 좋은 대답일 수 있겠으나 결과가 맞지는 않다.
잘 모르겠으면 인간이 좋아할 만한 쪽으로 답을 내놓는다.
근데.. 진짜 자동화를 원한다면 인간의 기분따위는 신경쓰지 않고 정확하게 해야겠지?
오늘날의 AI는 인간 선호도 최적화를 통해 오직 '보조'를 위해 설계되었다.
모델이 틀렸어도 RLHF로 최적화한 모델은 겉보기에는 그럴듯하고 맞아보이게 된다.
왜 모든 LLM은 사람의 개입이 필요한가(require a human in the loop)? => 애초에 모델을 그렇게 학습시켰기 때문이다.
그러니까 강연자는 다른 학습법이 필요하다는 얘기를 하고싶은거다.
그래서 뭘 하고싶나
강연자는 미래에는 자동화의 시대가 온다고 했다. 지금은 LLM의 지능에 비해 실제 자동화되는 작업이 거의 없지만(애초에 그렇게 학습하지 않았으니까) 앞으로는 그렇게 될 거라고 했다.
그래서 강연에는 안 나오는데, 새로운 학습법으로 만든 모델을 공개예정이라고 했고, 지금 시점에서 풀린 정보로는
RLCD(Reinforcement Learning for Calibrated Decisions)라는 자체 강화학습 방식을 썼다고 한다.
보상의 목표를 사람 선호가 아니라 결정의 정확도와 확률 보정(Calibration)에 둔 것이다.
모델이 결정 + 확률 출력
→ 실제 정답/결과와 비교
→ 확률까지 얼마나 정직했는지 Reward
→ "결정을 잘하고, 자신 없으면 자신 없다고 말하는 모델"
예를 들어 Jev가 100개의 문제에서 계속 “이 답이 맞을 확률 80%”라고 했다면 실제로도 대략 80개 정도가 맞도록 만드는 게 calibration의 목표라 할 수 있다.
감상
Jev자체의 활용 가능성은 무궁무진하다. 그래도 개발자의 철학을 듣고보니까 어디에서 사용해야할지 왜 써야할지가 좀 더 명확해진다.
학습법에 대해 얘기하자면, Jev가 토큰 뿐 아니라 그 속도에서 월등히 빠르고, 이미 사용자들이 이걸 적극 활용하고 있다는 점에서 RLCD는 이미 효과가 있다고 검증된걸로 봐도 좋을 것 같고, 앞으로도 새로운 학습 패러다임들의 등장을 가속화 할 것 같아 기대된다.
RHLF에대해서 고찰해보는것도 좋았다. 막연히 이런식이겠거니 했는데 그 장단점을 생각해보지는 못했으니까 말이다. 역시 도구의 사용법보다는 그 본질을 아는 게 중요한 거 같음
'AI코딩' 카테고리의 다른 글
| 그래프 엔지니어링 - 구글ADK (0) | 2026.09.14 |
|---|---|
| [case] 토스 FE개발자들의 AI결과 검증 (0) | 2026.09.07 |
| AI 활용 팁 (0) | 2026.05.23 |
| Matt Pocock 신규 스킬 4종 (0) | 2026.05.12 |
| 결국 기초가 중요하다 - Matt Pocock 강의 (0) | 2026.05.06 |