AI에 돈이 얼마 나가는지는 다들 아십니다. 어디로 나가는지를 모를 뿐이죠. 퀀트ID는 업무 한 건이 토큰 몇 개를 먹는지부터 재 드립니다.
어느 업무가 얼마를 썼는지는 어디에도 안 적혀 있습니다. 그래서 「줄이라」는 지시는 내려오는데, 정작 어디를 줄여야 할지를 모릅니다.
총액은 압니다. 건당 토큰은 모릅니다. 어디를 손볼지 고를 수가 없고, 손봐도 효과를 증명할 방법이 없습니다.
청구서가 오면 이미 쓴 돈입니다. 검침은 쓰는 중에 해야 쓸모가 있습니다.
후보 수백 개를 단계마다 통째로 다시 보냅니다. 화면 하나 처리하는 데 대형 모델을 스무 번 부릅니다.
최적화 문제가 아니라 회계 문제입니다. 전기도 수도도 계량기가 있으니까 관리가 됩니다. AI만 계량기가 없습니다.
재고, 적고, 등급 매기고, 그다음에 줄입니다. 흔한 「비용 절감」과는 순서가 반대입니다. 줄이는 게 먼저가 아니라 재는 게 먼저입니다.
한 번 재고 끝나는 일이 아닙니다. 업무가 바뀌면 원가 구조도 같이 바뀝니다. 계량기는 계속 돌아야 계량기죠.
읽고, 쓰고, 담고, 나르는 데서 각각 돈이 나갑니다. 네 군데가 서로 다른 항목이라 효과가 더해지는 게 아니라 곱해집니다. 물론 한 군데만 막아도 그만큼은 막힙니다.
후보를 한꺼번에 채점해서 쓸 것만 넘깁니다. 글자를 한 자도 만들지 않으니 없는 답을 지어낼 방법 자체가 없습니다.
쓰던 GPU에 쓰던 모델 그대로 두고 생성 속도만 올립니다. 나오는 답은 바이트까지 똑같습니다.
등급을 내릴수록 작아지고, 작아질수록 뭔가는 잃습니다. 「손실 없다」고 하지 않고 얼마나 잃는지 재서 보여드립니다.
큰 GPU 서버 없이 현장 장비에서 돌립니다. 막히는 건 용량이 아니라 메모리 대역폭이라, 그 선이 어디인지를 재 드립니다.
압축은 돈을 아끼고, 가속은 시간을 아낍니다. 서로 하는 일이 다릅니다. 실제로 재보면 후보를 3.9배 줄여도 한 건 걸리는 시간은 3.205초에서 3.159초로 거의 안 줄었습니다. 읽는 데 0.033초, 쓰는 데 3.17초가 걸리니까요. 그래서 둘 다 필요합니다.
어느 업무가 어느 단계에서 토큰을 몇 개 썼는지 줄줄이 적은 장부입니다. 회계 원장이랑 같은 물건이라고 보시면 됩니다. 있으면 감사에서 답할 수 있고, 없으면 총액밖에 못 댑니다.
| 업무 | 단계 | 후보 | 입력 토큰/건 | 월 건수 | 등급 |
|---|---|---|---|---|---|
| 여신 원장 화면 조작 | 대상 선별 | 212 | 4,708 | 180,000 | C |
| 상담 기록 민감정보 점검 | 구간 판정 | 96 | 2,148 | 420,000 | B |
| 관제 알람 선별 | 우선순위 | 1,340 | 29,615 | 31,000 | D |
| 사내 검색 재순위 | 후보 압축 | 50 | 1,132 | 610,000 | A |
| 월 합계 | 1,241,000 | C | |||
보시기 쉽게 만든 예시입니다. 실제 장부는 귀사 로그에서 뽑습니다.
모델 성능 등급이 아닙니다. 얼마나 들여다보고 있느냐의 등급입니다. D를 받아도 모델이 나쁘다는 뜻이 아니라, 아직 안 재봤다는 뜻입니다.
건당 토큰도 알고, 분해도 되고, 줄이고 있고, 계량기까지 돌고 있습니다.
분해도 줄이기도 하는데 계량기가 없습니다. 업무 바뀌면 슬그머니 되돌아갑니다.
청구서 숫자는 압니다. 그 안에서 어디가 먹는지는 모릅니다.
건당 토큰을 모릅니다. 줄일 대상 자체가 아직 안 정해진 상태입니다.
등급만 알려드리고 끝나지 않습니다. 검침을 받은 기업은 아래 마크를 쓰실 수 있습니다. 감사·제안서·홈페이지에 붙이시면 「원가를 재고 있는 회사」라는 표시가 됩니다.
토큰 원장을 받고 등급 판정까지 마친 기업
A 또는 B 등급을 받은 기업. 등급과 판정일을 함께 표기합니다
검침 구독 중인 기업. 계량기가 계속 돌고 있다는 표시입니다
마크는 등급이 유효한 동안만 씁니다. 검침을 멈추면 마크도 내려갑니다. 그래야 마크가 값을 합니다.
수치만 적어두고 「믿어달라」고 하지 않겠습니다. 어떤 판에서 무엇과 비교해 쟀는지, 그리고 어디까지가 아직 안 재진 영역인지를 같이 적었습니다.
2,018문항 5개 분야를 같은 코드로 채점했습니다. 무생성 판정기끼리만 붙였고, 공개 판정기는 공개된 가중치를 그대로 썼습니다.
후보 200개일 때 4,444토큰, 50개로 줄였을 때 1,132토큰. 같은 장비에서 잰 값이고, 자가 검침 계산기도 이 두 점에 맞춰 돌아갑니다.
캐시 적중 0%에서 쟀고, 온도 0으로 돌린 출력이 바이트까지 같은 것을 확인했습니다. 품질을 깎아서 얻은 속도가 아닙니다.
| 항목 | 어디서 잰 값인가 | 아직 안 잰 것 |
|---|---|---|
| 화면 후보 추리기 | 영어 화면 데이터셋 | 한국어 화면 — 도입 검증 때 귀사 데이터로 잽니다 |
| 판정 정확도 | 우리 2,018문항 보드 | 귀사 업무 분포 — 프로파일 재생성 후 재측정 |
| 가속 배수 | 동시 사용자 8 / 32 / 128 / 256명 | 그 밖의 구간, 귀사 트래픽 형상 |
| 압축 등급 | Q8은 사실상 그대로, Q4는 프로파일 재생성 필요 | 더 낮은 등급의 업무별 허용선 |
| 엣지 구동 | 한계는 용량이 아니라 메모리 대역폭 | 귀사 현장 장비에서의 실제 상한 |
오른쪽 칸을 비워두지 않은 것이 이 표의 핵심입니다. 안 잰 걸 안 쟀다고 적어두면, 잰 것도 믿으실 수 있습니다. 자세한 근거는 아래 소개서에 실었습니다.
아래 넷은 전부 저희가 직접 잰 값입니다. 판이 무엇이었고 무엇과 붙였는지 그림 밑에 같이 적었습니다. 대조군 없이 그린 그래프는 하나도 없습니다.
한가할 때는 3분의 1 남짓으로 줄지만, 붐비면 4분의 3까지만 줄어듭니다. 도입 검토는 붐빌 때 숫자로 하십시오. 한가할 때 숫자로 계획을 세우면 장비가 모자랍니다.
여기 없는 것도 말씀드립니다. 압축(양자화)은 저희 자체 방식보다 공개된 방식이 더 나은 구간이 실측으로 확인됐습니다. 그래서 「우리 압축이 최고」라고 쓰지 않고, 귀사 업무에서 어느 쪽이 나은지 재서 나은 쪽을 붙입니다. 파는 것은 방식이 아니라 재는 능력입니다.
숫자 세 개, 질문 네 개면 지금 등급이 나옵니다. 입력하신 건 저장하지 않습니다.
망 안에서 직접 돌리시면 토큰 단가라는 게 없습니다. 비워두시면 토큰 개수로만 보여드립니다.
여신·수신 원장 화면 조작, 개인신용정보 구간 판정, 자동화 결정 설명 근거, 이상거래 알람 선별.
EMR·OCS 화면 업무, 건강정보 비식별화, 동의서 조항 선별, 의무기록 검색 재순위.
완전 폐쇄망 문서·행정, 비공개 사유 후보 분류, 반출 전 점검, 사이버 관제 알람 선별.
되돌릴 수 없는 명령의 실행 직전 판정, ERP·그룹웨어 화면 업무, 비밀정보 탐지, 관제 선별.
이건 저희가 안 합니다. 대출 승인 여부를 판단하지 않습니다. 진단도 처방도 하지 않습니다(그래서 의료기기 소프트웨어 인증 대상이 아닙니다). 코드를 대신 짜지 않고, 교전이나 표적 관련 판단은 아예 범위 밖입니다. 저희가 하는 건 후보를 재서 골라내는 데까지고, 마지막 결정은 원래 쓰시던 체계에 그대로 남습니다.
이 페이지에서 등급부터 보십시오. 자료 주실 것 없습니다.
쓰고 계신 로그로 장부를 뽑습니다. 어느 업무가 얼마를 먹는지 여기서 드러납니다.
GPU 한 장짜리 장비를 들고 찾아뵙니다. 자료는 밖으로 안 내보내고 그 자리에서 다시 잽니다.
합격선을 계약 전에 같이 정하고, 나온 숫자로 판단하십시오. 그다음부터 계량기를 상시로 돌립니다.
합격선은 저희가 정하지 않습니다. STEP 3에서 귀사 화면, 귀사 문서로 다시 재고 그 숫자가 기준을 넘는지 보시면 됩니다. 여기 적힌 수치는 어디까지나 저희 시험 환경 값입니다. 귀사 숫자는 귀사 데이터로만 나옵니다.
원천 기술은 제휴로 확보하고, 묶어서 공급하고 책임지는 건 저희가 합니다. 네 가지 기술 때문에 네 군데와 따로 계약하실 일은 없습니다.
무생성 판정 엔진과 추론 가속. 전략적 제휴 및 개발 지원으로 확보했습니다.
모델 양자화와 엣지 구동. 전략적 제휴 및 개발 지원으로 확보했습니다.
뭘 도입할지 정하기 전에, 지금 어디에 쓰고 계신지부터 보는 게 순서입니다.