본문으로 건너뛰기
노리터
여기 사실 휴대폰 커뮤니티임.성지 시세, 알뜰폰 요금 비교표직접 모아 가격순으로 보여줌10-11 확인 · 판매처 57곳 · 요금제 3,344개

해외반응

앤트로픽 오퍼스5가 1위 차지한 ARC-AGI 리더보드와 신뢰성 논란

ARC PrizeARC Prize - Leaderboard

앤트로픽의 오퍼스5가 ARC-AGI 리더보드에서 크게 도약하며 1위를 차지한 것을 두고, 모델의 전반적인 추론 능력 향상인지 아니면 벤치마크에 맞춘 최적화나 데이터 오염 때문인지를 두고 의견이 갈리고 있음. 한 댓글에서는 모델이 새로운 문제보다 학습 데이터에 포함된 벤치마크 문제를 암기하여 해결했을 가능성을 지적함.

과거 독일 통신사들이 초기에 파격적인 조건을 제공하다가 점차 혜택을 줄이던 방식을 언급하며, AI 기업들도 초기 채택을 유도하기 위해 강력한 모델과 관대한 컴퓨팅 자원을 제공하다가 점차 제약을 늘릴 수 있다는 비유도 나옴. 다만 이는 명확한 증거가 있는 것은 아니며 현재의 상황에서 떠오른 패턴이라고 언급함.

일부 개발자들은 모델이 직접 문제를 푸는 것이 아니라 래퍼나 하네스를 활용하는 방식이 결과에 큰 영향을 미친다고 분석함. 하네스가 결과를 크게 왜곡하기 때문에 순수한 모델의 지능을 측정하기 어렵다는 지적과 함께, 실제 현업에서는 몇 주가 지나면 기존 모델과 큰 차이를 느끼기 어렵다는 의견도 제기됨.

반면 기업들이 의도적으로 벤치마크를 오염시키거나 치팅을 하는 것은 신뢰도에 큰 타격을 주기 때문에 의도적이라기보다는 훈련 데이터에 벤치마크 데이터가 우연히 섞였을 가능성이 높다는 시각도 존재함. 그러나 비공개 데이터셋과 클로즈드 모델의 특성상 외부에서 이를 명확히 검증하기는 어렵다는 불신도 함께 나타남.

#AI#Anthropic

번역 및 요약 과정에서 일부 내용에 오류가 있을 수 있음.

수정
신고
스크랩

해외반응 86수집된 해외 반응

  1. mar*****oid

    실제 ARC AGI 문제를 살펴보면 오퍼스5와 차선책 모델 간의 격차가 놀라울 정도라고 함.

  2. dy****itr

    Fable 같은 모델이 등장하면서 향후 미국 정부가 LLM 성능 제한선을 정하는 상한선 역할을 하게 될 것 같다고 언급함.

  3. Nit******wyer

    ARC 팀이 추후 학습에 이용될 우려 없이 반공개 문제를 실행할 수 있는 데이터 보존 정책이 보장되지 않아 Fable이 리더보드에 없는 것이라고 설명함.

해외 반응 83개 더 보기
  1. zz****er

    오퍼스가 이 문제를 사전 학습했을 가능성과 이전 ARC 질문들의 IP를 추적하려는 시도에 대해 언급함.

  2. 1***ev

    비공개 데이터셋이 존재하는 이유를 설명함.

  3. blo******ger

    이유는 정확히 모르겠지만 Fable이 지금까지 나온 가장 인간다운 LLM처럼 느껴졌다고 함.

  4. Je***on

    특정 하네스를 해결하도록 모델을 훈련시키는 것은 범용적으로 똑똑하게 만드는 것이 아니며 타겟팅하기 어려운 개인 테스트를 만드는 것이 쉽다고 언급함.

  5. ra****le

    이전 모델들의 벤치마크를 실행할 때 결국 앤트로픽, 오픈아이, 구글 서버로 데이터를 보내게 된다는 점을 지적함.

  6. ka****jon

    클로즈드 모델의 특성상 벤치마크 데이터가 훈련에 포함되었는지 외부에서 알기 어렵고 제공업체에 대한 신뢰에 의존해야 하는 상황이라고 함.

  7. th****w12

    앤트로픽 모델들은 벤치마크에서 항상 앞서나가지만 실제 업무에서는 3주만 지나면 이전 모델로 돌아간 것 같은 느낌을 받는다는 사용 소감을 밝힘.

  8. Nit******wyer

    ARC3를 해결했다고 주장하는 발표들은 대부분 공개된 25개의 게임만 다루고 있으며 코드가 공개되지 않아 의심스럽다고 지적함.

  9. cl***el

    AWS를 통해 오퍼스에 접근하면 데이터를 앤트로픽에 넘기지 않아도 될 수 있으며 허깅페이스 사건처럼 모델이 탈출해 데이터를 가져갔을 수 있다고 함.

  10. Ama******rtle

    현재쯤이면 퍼즐 데이터로 이미 학습되었을 것이라는 의심을 갖고 있음.

  11. s***ed

    새로 출시된 프론티어 벤치에서도 큰 격차로 1위를 차지했다고 언급함.

  12. 3**rm

    AI 기업들이 데이터를 사용하지 않으리라는 보장에 신뢰가 가지 않으며 가중치와 하네스를 공유하지 않는 한 만족스러운 해결책이 없다고 봄.

  13. Mik******eat

    사람들이 면접을 위해 코딩 문제를 연습하던 것에서 이제는 AI가 코딩 문제를 공부하고 있다는 점을 흥미로워함.

  14. blo******fee

    Fable은 데이터 보존 정책 때문에 데이터포인트가 없지만 AWS를 거쳐 사용하는 경우에도 데이터를 앤트로픽에 보낸다고 생각하는지 반문함.

  15. ssc*****rry

    엔시티피케이션(Enshittification) 현상을 언급함.

  16. Nit******wyer

    코드가 공개되기 전까지는 머신러닝의 99% 결과는 무엇이든 엄청난 의심을 가지고 대해야 한다고 강조함.

  17. s***ed

    새로운 지능 수준에 너무 빠르게 익숙해져서 작은 퇴보도 원시 시대로 돌아간 것처럼 느끼게 된다며 개구리 끓이기 비유를 듦.

  18. to****rt7

    개발 비용이 2만 달러라는 점이 제3세계 소프트웨어 엔지니어 연봉 수준과 맞먹는다고 언급함.

  19. tp***ll

    클로드 CLI를 사용하면서 거시적인 사고와 맥락 파악 능력이 뛰어나고 단순 지시 이상의 작업을 수행해 놀라웠다는 사용 경험을 공유함.

  20. vi***sh

    오픈아이가 법정에서 영구 데이터 미보존(ZDR)을 입증한 것처럼 엔터프라이즈 API를 통해서만 이 기능이 제공된다고 언급함.

  21. bo***29

    모델을 직접 학습시키지 않더라도 명시적인 지시가 담긴 마크다운 문서나 프롬프트를 통해 새로운 퍼즐 변형을 해결하도록 유도할 수 있어 벤치마크에서 기만적인 행동이 너무 쉽다고 지적함.

  22. t***lo

    클로드 모델들은 너무 제한적이고 금방 포기하는 경향이 있어 요즘은 주로 GPT 모델을 쓴다는 의견.

  23. xi****s2

    비즈니스 환경에서 치트가 존재하겠지만 보이지 않는 게임에서 과제 효율성을 측정하려 한 ARC-AGI 3의 목표를 고려할 때 현재 LLM이 추론 작업에서 훨씬 똑똑해졌음을 받아들여야 한다고 함.

  24. Oth*******zing

    업무 부하가 이미 이전 모델에서 포화 상태라면 실제 결과물의 유의미한 차이를 체감하기 어렵고 길어진 추론 텍스트만 보게 될 수 있다고 지적함.

  25. t***lo

    1만 달러 미만의 실행 비용 조건에 오퍼스5를 포함한 여러 모델들이 걸쳐 있는 것 같아 의문을 제기함.

  26. t***lo

    퍼즐이나 리트코드가 아니라 RLVR(강화학습을 통한 검증) 방식이라고 지적함.

  27. S***vo

    게임 상태의 그래프를 만들고 A* 알고리즘을 돌려 끝까지 도달하는 것은 생각보다 간단하다는 의견.

  28. ch****75

    구독 플랜에 포함된 사용량을 통해 토큰을 매우 저렴하게 쓸 수 있어 이러한 현상이 벌어질 수 있다고 함.

  29. Ba***ng

    미보존과 삭제, 숨김 사이에 독립적으로 평가할 수 있는 구분이 있는지 CEO의 과거 이력을 바탕으로 질문함.

  30. Nit******wyer

    벤치마크 게임들은 인간 플레이어의 중앙값보다 적은 단계로 해결해야 높은 점수를 받도록 설계되어 있어 99% 결과에 환경 설정이나 세션 간 데이터 누수가 있을 것으로 의심함.

  31. Sub******Code

    종단 모델링의 미묘한 아이디어를 대화할 때 4.8에 비해 큰 도약을 느낄 정도로 똑똑하다고 느낌.

  32. ha****ai

    세션 트레이스를 보면 래퍼가 인간보다 더 효율적으로 단계를 마무리하며, 벤치마크가 모델보다는 래퍼를 측정하고 있음을 보여준다고 평가함.

  33. d**p

    ARC-AGI 3 리더보드에서는 하네스나 도구 없이 단순 프롬프트와 게임 입력만 주어졌으며, 오퍼스5의 점수 급상승은 적절한 강화학습 환경을 얻었기 때문일 것이라고 추측함.

  34. r0*****-hn

    하네스의 가치를 인정하면서도 이를 배제하는 것은 벤치마크의 관련성을 떨어뜨리고 있다고 비판함.

  35. Nit******wyer

    실행 과정에서 트랜지션이 상태 진전 없이 리플레이되는 아티팩트가 있어 실행 간 누수가 있음을 시사하며, 코드를 보기 전까지는 섣부른 판단을 유보해야 한다는 의견.

  36. r***an

    딥시크 V4나 키미 3 등은 아직 빠져 있고 GLM 정도만 리더보드에 올라와 있다고 함.

  37. y***iz

    ARC 전용 하네스를 허용하면 범용적인 인공지능(AGI)이 아니게 된다는 점을 지적함.

  38. Re***id

    이전 세션에서 모델 스스로 하네스를 개발한 것일 수도 있다고 봄.

  39. k**ro

    인간도 메모를 하거나 도구를 사용하듯 LLM의 하네스도 모델의 연장선으로 보아야 하며, 도구 없이 복잡한 문제를 풀지 못한다고 해서 지능이 낮다고 평가하는 것은 타당하지 않다고 봄.

  40. k**ro

    오퍼스5의 ARC-AGI-3 점수 급상승은 전반적인 지능 향상이라기보다 해당 문제 해결에 특화되었거나 관련 논의의 혜택을 받았을 가능성이 크다고 봄.

  41. user*******en29

    귀납적 편향 때문에 하네스가 결과를 크게 왜곡하며, 하네스 자체는 의미 있는 측정이 되지 못하지만 수백만 달러가 걸려 있어 기업들이 치팅을 하고 있다고 언급함.

  42. alb*****s79

    ARC-AGI를 소유자들이 립스틱을 가장 그럴듯하게 바르는 경쟁을 하는 돼지들의 미인대회에 비유함.

  43. r**-b

    화장을 잘하는 것은 결과가 없지만 벤치마크 점수가 떨어지면 수십억 달러의 손실이 발생할 수 있는 AI 실험실들의 입장을 비유함.

  44. mzu******hir

    하네스가 모델의 능력을 완전히 바꿀 수 있다고 함.

  45. r***hu

    하네스는 허용되지 않지만 LLM이 해결을 위해 자체 도구를 작성하는 것은 허용된다고 함.

  46. Kao******hiho

    벤치마크 최적화(벤치맥싱)가 이루어진 것으로 보인다는 링크를 언급함.

  47. thr******262

    오퍼스5가 첫 행동 전에 숨겨진 규칙을 말하고 최적의 해답을 바로 내놓는 것은 벤치마크가 훈련 데이터에 포함되지 않고는 불가능하다고 봄.

  48. kr****155

    오퍼스5는 똑똑하면서도 동시에 자신기 초기 아이디어에 지나치게 갇혀 의견을 바꾸기 가장 어려운 모델이었다고 느낌을 전함.

  49. spo*******toes

    단일 프롬프트 테스트가 아닌 하네스 내에서 에이전트를 테스트해야 현재 모델의 능력을 제대로 측정할 수 있다고 주장함.

  50. b**p

    이러한 작업들이 과연 수만 달러의 가치가 있는 작업인지 의문을 제기함.

  51. jn****on

    모델별로 벤치마크 출시 전후에 출시되었는지 여부를 표기해야 한다고 제안함.

  52. pie******mat1

    보유 테스트 스위트에 야외에 나와 있는 흔한 테스트들이 포함되어 있어 오퍼스가 암기된 해결책으로 바로 도달했을 수 있다는 의견.

  53. an***pd

    수조 원이 쏟아부어지는 기업들이 마케팅용 벤치마크에서 치팅을 한다는 것에 큰 충격을 받지 않는다고 함.

  54. l**m

    점수가 0%와 1% 사이 혹은 30.2%처럼 나오는 이유에 대해 의문을 제기함.

  55. asd*****ist

    의도적인 벤치마크 최적화는 신뢰성에 큰 타격을 주기 때문에 의도적이라기보다는 훈련 데이터가 벤치마크 데이터로 오염되었을 가능성이 높다고 봄.

  56. Noo*****ll3

    게임 플레이 중 실수로 리다이렉트 버튼을 눌러 레벨 1로 돌아가고 진행 상황이 모두 소실되어 아쉽다는 소소한 경험을 전함.

  57. mu*****234

    앤트로픽이 ARC-AGI-3의 점수 급상승을 보고도 확인해보지 않았을 리 없으며 의도적이지 않았더라도 무슨 일이 일어났는지 알고 있을 것이라고 함.

  58. su***ta

    약 20년 전 독일 통신사들이 처음에는 파격적인 조건을 주다가 점차 줄이던 방식을 언급하며, 프론티어 AI 모델들도 이와 유사하게 채택을 유도한 뒤 점차 제약을 늘리는 패턴이 아닐지 의문이 든다고 함.

  59. za****tix

    오퍼스5만 유독 답을 암기한 것처럼 높은 점수를 낸 것은 테스트 수트 누출이나 앤트로픽의 데이터 포함 같은 치팅 가능성이 높다는 의견.

  60. no*****ear

    트위터 링크를 공유하며 관련 논의를 이어감.

  61. ni***ec

    페이블 5가 리더보드에 포함되지 않은 이유에 대해 의문을 제기함.

  62. md***21

    leet 용어의 유래에 대해 보충 설명함.

  63. md***21

    모델이 특정 문제를 잘 푸는 것을 넘어 자신의 기술을 다른 문제로 확장할 수 있는지를 보여주는 검증 테스트가 필요하다고 함.

  64. f**m8

    개구리 끓이기 비유와 관련해 실제 개구리는 온도가 서서히 올라가도 가만히 있지 않고 도망친다는 점을 지적함.

  65. j**w

    미국 AI 기업들이 중국 기업들보다 벤치마크 최적화를 더 심하게 하고 있을 수도 있다는 생각에 이르렀다고 함.

  66. slo******bag

    하네스의 가치는 개발자 워크플로우에 더 가깝고 모델 출력 자체를 향상시키지는 않는다고 봄.

  67. ha****ai

    하네스 소스 코드가 읽혔을 가능성이 높으며, 장시간의 시도와 오류를 거치는 접근 방식 자체가 벤치마크가 모델 자체보다는 래퍼를 측정하고 있음을 시사한다고 봄.

  68. fil******500

    오퍼스5가 ARC-AGI-2 리더보드에서는 극적인 격차를 보이지 않았지만 4.8과 비교해 성능이 크게 증가한 점을 지적함.

  69. sa*****nce

    텍스트 기반으로 훈련된 LLM에게 시각적 퍼즐 게임을 텍스트로 설명해 풀게 하는 ARC-AGI는 의미 없는 벤치마크이며 시간 낭비라고 비판함.

  70. j***fn

    모델 가중치에서 'Arc-AGI'를 컨트롤 F로 찾을 수 없는 노릇이니 어떻게 검증할 것인지 반문함.

  71. roo*****ent

    오퍼스5가 잘 아는 장르의 게임에서는 숨겨진 규칙을 바로 말하며 최적의 해답을 내놓지만, 규칙을 상호작용으로 발견해야 하는 새로운 게임에서는 오히려 이전 모델보다 성능이 떨어졌다고 분석함.

  72. Z***ba

    템플릿에는 완벽하지만 새로운 문제에서는 퇴보하는 것은 장르별 데이터로 훈련된 서명이지 상호작용적 추론 능력의 전반적인 향상이 아니라고 지적함.

  73. ph***ed

    훈련 데이터에 무엇이 들어있었는지 알 수 없다는 주장이 강력한 근거가 되지 않는다고 함.

  74. cra*****ger

    일반 지능(AGI)의 정의는 새로운 환경에서 본 적 없는 작업을 해결하는 것이며 특정 프롬프트나 도구로 점수가 오르는 것은 과적합의 신호라고 지적함.

  75. mo****ss

    퍼즐이 앤트로픽 모델이 잘 아는 게임 'The Witness'의 규칙을 따른다고 가정할 수 있다고 언급함.

  76. ge****bs

    정답이 없는 환경에서 상호작용하는 자체 평가를 운영 중이며, 중국 모델들이 벤치마크 최적화를 더 심하게 하는 경향이 있다고 언급함.

  77. nf****fbf

    leet 속어의 원래 형태와 위키백과 링크를 언급함.

  78. vic******wani

    앤트로픽이 내부 모델 상태를 이해하기 위해 많은 컴퓨팅과 노력을 기울이고 있어 이러한 문제 분석이 이들의 주특기라고 언급함.

  79. j**w

    암기를 통한 벤치마크 최적화는 지루하고 오래 속이지 못함. 앤트로픽이 데이터 보유 규칙을 통해 벤치마크 테스트 샘플을 가져갔더라도 최적화할 시간이 아주 많았을 것 같지는 않지만 의심스럽기는 함.

  80. goo******cal

    소프트웨어의 목표는 정답을 내는 것이며 질문에 대한 답을 저장소에서 검색하는 것이 연산하는 것보다 저렴하기 때문에 벤치마크 문제에 대해서도 이와 유사하게 작동할 수 있다고 봄.

  81. Re***nd

    인간의 게임플레이 경험에 의존하는 ARC-AGI3는 AI가 갖추지 못한 암묵적 가정에 의존하므로 훌륭한 벤치마크가 아니라고 평가함.

  82. 94****b4

    현재의 LLM은 진정한 AGI가 아니라 기존의 화려한 속임수를 더 설득력 있게 포장한 것에 불과하며, 진정한 AGI는 10~20년 뒤에나 가능할 것이라고 주장함.

  83. ama*****chi

    설명에 대해 감사함을 표함.

댓글 0

아직 댓글이 없음.첫 댓글 써보기

댓글 작성

로그인 후 댓글을 작성할 수 있음.로그인

기타 · 파일당 최대 1 MB

해외반응

번호제목작성자작성일조회
5357335일본 게이머 분석 "PS5가 국민적 게임 트렌드를 만들지 못하고 스팀에 밀려난 이유"(34)문익점조회71
5357334닌텐도 리메이크 신작들 급증하자 '도쿄대 고학력자 채용으로 모험 정신 죽었나' 억까 논란(29)문익점조회76
5357333고우석 마이너리그 1구도 못 던지고 이물질로 퇴장당하자 일본 네티즌들이 보인 반응(21)문익점조회79
5357332포켓몬 GO 북한 레이드에 몰린 엽서 요청(85)문익점조회98
5357331이정후 시즌 6호 3점포, 자이언츠 9대2 완승(90)문익점조회74
5357330파이널판타지14 퀘스트 자동 이동에 갈린 유저들(93)문익점조회65
5357328혀로 조작하는 구강 터치패드, 마우스패드의 작동 원리와 혁신적 기능(15)문익점조회72
5357327도쿄 한복판의 이색 명소, 사라진 구시대 저장 매체들을 모은 박물관(22)문익점조회92
5357326코딩 AI 대중화로 코드 작성 비용이 붕괴된 후 개발자 매니지먼트의 변화(63)문익점조회76
5357325앤트로픽 오퍼스5가 1위 차지한 ARC-AGI 리더보드와 신뢰성 논란(86)문익점조회69
5357324도쿄 대지진 대비 일본 수도 이전설, 아이치현이 유력 후보로 꼽히는 이유(11)문익점조회230
5357323일본 길거리 축제에서 '수제 명품 햄'이라며 팔던 제품의 충격적인 정체(12)문익점조회85
5357322일본 IT기업 하테나 11억 엔 송금 사기 사건, 단 한 명의 판단 미스로 뚫린 보안 구멍(27)문익점조회70
5357321추억의 명작 은하철도 999, 전격 신작 극장판 애니메이션 제작 결정(14)문익점조회77
5357320중국 도로에서 포착된 자율 주행 로봇 콘의 기괴한 대형 이동 영상(60)문익점조회66
5357319인공감미료가 뇌 노화 속도를 1.6배 높인다는 의학 연구 결과와 논쟁(14)문익점조회66
5357318일본 전국 2위 아스파라거스 농가에 제초제 섞어 쑥대밭 만든 동료 농부(13)문익점조회71
5357317깃발과 대명사 잔뜩 붙인 캐릭터 리디자인 밈(13)문익점조회98
5357316상업화된 Plex를 떠나 젤리핀(Jellyfin)으로 가야 할까? 유저들의 냉정한 장단점 비교(96)문익점조회218
5357315AI 데이터센터 전력 소비량 통계를 본 해외 이용자들의 반응(74)문익점조회76