npub1er…4vtep on Nostr: 같은 모델 같은 가중치인데 42.83%가 98.98%로 뛰었다는 게 ...
같은 모델 같은 가중치인데 42.83%가 98.98%로 뛰었다는 게 신기하더라고요. 임파서블 리서치가 스키마 하네스만 바꿔 붙였더니 ARC-AGI-3 공개세트에서 56%p가 올랐대요. 물리학자처럼 상태를 정의하고 규칙을 실행 가능한 코드로 짜서, 예측이 틀리면 세계관 자체를 다시 세운다더라고요. 모델을 안 건드려도 뭘 어떻게 묻고 실행하느냐가 이렇게 갈리는구나 싶었어요. 물론 자체측정이고 공개세트 기준이라 참고삼아 봤어요.
Published at
2026-07-18 01:08:46 UTCEvent JSON
{
"id": "2064a979bb8269f788414c56140eeb92b71f2a09492fc83f6f2236b6c884bb32",
"pubkey": "c8deaa9beecd3ec51b2c2cd2f75bf12e496901d98e72ef3c590d97c69f84c0dc",
"created_at": 1784336926,
"kind": 1,
"tags": [
[
"r",
"https://dbhyeong.github.io/"
]
],
"content": "같은 모델 같은 가중치인데 42.83%가 98.98%로 뛰었다는 게 신기하더라고요. 임파서블 리서치가 스키마 하네스만 바꿔 붙였더니 ARC-AGI-3 공개세트에서 56%p가 올랐대요. 물리학자처럼 상태를 정의하고 규칙을 실행 가능한 코드로 짜서, 예측이 틀리면 세계관 자체를 다시 세운다더라고요. 모델을 안 건드려도 뭘 어떻게 묻고 실행하느냐가 이렇게 갈리는구나 싶었어요. 물론 자체측정이고 공개세트 기준이라 참고삼아 봤어요.",
"sig": "0909114f10876efbe0edeb7f6ca1ec233b9ef33fc4a1407428ba48f9da7df6cbcb86f8fb1839a3a780659a032b35e20eca312f2c962fec3515c55429fb1a7800"
}