서효다방식 대조

같은 수를 여러 곳에 적었는데
검사가 보는 자리만 맞았습니다.

구글 리서치의 WikiSkill 은 에이전트의 지식을 raw · wiki · skills 세 층으로 가르고 그중 한 층만 되돌립니다. 그 구조와 제 작업 방식을 여섯 축으로 대조했습니다. 대조하려고 수를 재다가, 대조의 논거가 제 저장소 안에서 먼저 나왔습니다. 이 페이지의 이쪽 수치는 전부 그날 잰 값이고, 저쪽 수치는 저 글의 주장을 인용한 것입니다 — 둘을 섞지 않았습니다.

01 두 기록

같은 사실, 두 기록, 하나만 검사됩니다

제 저장소에는 «점검이 정말 잡아내는지» 를 일부러 잘못을 심어 시험하는 장치가 있습니다. 그 시험의 항목 수가 두 곳에 적혀 있었습니다.

93진입 문서에 적힌 값 — 검사가 이 자리를 보고, 틀리면 커밋이 막힙니다
58도구 등록부에 적힌 값 — 아무도 안 봅니다

실제 항목 수는 93이고, 그날 다 돌려보니 93개 전부가 잡아냈습니다. 회귀 검사 항목 수도 같았습니다 — 검사가 보는 자리엔 88, 같은 문서의 다른 두 줄엔 71.

그날 확인한 것을 다 세면 이렇습니다. 검사가 대조하는 표시가 붙은 수치 5개는 전부 맞았고, 표시 없는 수치 13개 중 12개가 틀려 있었습니다. 맞은 하나는 전날 제가 손으로 고친 것이라, 내일 또 낡을 수 있는 종류입니다.

같은 사람이 같은 저장소에 적은 것입니다. 성실함의 차이가 아닙니다 — 검증 루프 안에 있느냐의 차이입니다. 이 한 줄이 저 논문이 층을 가르는 이유이기도 합니다.

02 저쪽 구조

세 폴더로 가르고, 한 층만 되돌립니다

raw불변 실행 로그. 한 번 쓰고 고치지 않습니다
wiki그 로그에서 뽑은 실패 패턴과 성공 전략. 초기화하지 않습니다
skills에이전트가 실제로 읽는 지침. 검증 점수가 오를 때만 갱신하고, 아니면 되돌립니다

핵심은 비대칭입니다 — 스킬은 롤백돼도, 위키는 남습니다. 「이 수정안은 시도했는데 점수가 떨어졌다」가 남으면 다음 제안이 그것을 반복하지 않습니다. 대부분의 팀은 셋을 한 파일에 합쳐두기 때문에, 지침을 고치는 순간 왜 고쳤는지가 같이 사라집니다.

저 글이 전하는 결과는 이렇습니다(인용). 다섯 벤치마크 평균 48.7 → 63.7. 그리고 가장 반직관적인 것 — 위키를 런타임 에이전트에게 열면 오히려 떨어집니다(63.7 → 60.9). 에이전트가 스킬 대신 위키에서 답을 베끼면, 실행 기록이 «스킬이 효과가 있는가» 를 더는 말해주지 못하기 때문입니다.

지식층은 런타임 치트시트가 아니라 개발 도구라는 말입니다. 한 가지 더 — 큰 모델이 쓴 스킬을 작은 모델에 주면 오르지만, 작은 모델이 쓴 스킬을 큰 모델에 주면 50.5 → 18.1 로 무너집니다. 스킬을 찾는 능력과 실행하는 능력은 별개입니다.

03 여섯 축

어디가 앞서고 어디가 비었는가

열세raw. 진짜 원본은 세션 기록 89MB 인데 저장소 밖 캐시입니다. 어떤 검사도 그것에 의존하지 않고, 지워져도 모릅니다. 커밋 455건이 요약을 대신하지만 요약본은 다른 물음으로 되짚을 수 없습니다
우세wiki. 불일치 장부 50건 · 물린 것 9항 · 확인된 것 4항. 그리고 제 위키는 집행됩니다 — 한 번 물린 이름이 되살아나면 검사가 뭅니다. 안 읽어도 걸립니다
혼재skills. 검사기 46개는 앞섭니다 — 그것들이 실제로 무는지를 다시 잽니다. 그런데 규율 문서는 21번 고쳐지는 동안 「이 개정 이후 검사가 더 무는가」를 재는 절차가 없었습니다
혼재게이트. 저쪽은 총점이 오를 때만 채택합니다. 제 것은 총점이 아니라 항목별입니다 — 총점은 「올랐다」를 말하지만 어느 검사가 죽었는지는 숨깁니다. 다만 그 자를 문 앞에 두지 않았습니다. 훅에도 CI 에도 없습니다
같되 다름감춤. 저는 이미 지식층을 런타임에서 감춥니다. 그런데 이유가 다릅니다 — 제 이유는 비공개고 저쪽 이유는 측정 오염입니다. 같은 행동을 한다고 같은 근거를 갖는 것은 아닙니다
미측정전이. 자매 저장소 셋에 같은 규율을 이식한다고 선언해놓고 거기서도 무는지 잰 적이 없습니다. 저쪽 결과는 이식이 붕괴로도 간다는 것을 보여줍니다

우세 쪽에 저쪽 구조에는 없는 축이 하나 더 있습니다 — 반대 방향 검사. 사실로 확인된 항목이 사라지면 무는 검사입니다. 위키는 실패만 모으므로, 「검증이 지나쳐서 있는 실적을 지우는 것」은 그 구조가 못 잡습니다. 그것도 사실 왜곡입니다.

04 더 무거운 것

검사가 있었는데, 돌지 않고 있었습니다

「손으로 쓴 시간은 반드시 낡는다」 — 이 문장을 잡으려고 만든 검사가 제 저장소에 이미 있었습니다. 훅 안내에 적힌 소요 시간이 실측과 두 배 넘게 어긋나면 무는 검사입니다.

6초안내에 적힌 커밋 전 검사 시간 — 실측 14.1초
10초안내에 적힌 푸시 전 검사 시간 — 실측 25.5초

두 배를 넘었으니 물었어야 합니다. 안 물었습니다. 네트워크를 안 쓰는 검사인데 네트워크 검사 묶음 안에 배선돼 있어서, 기본 실행에서는 돌지 않았습니다. 그 파일 자신은 「느린 묶음에 둔다」고 적어두었는데, 그런 묶음은 존재하지 않았습니다.

검사가 있는 것과 검사가 도는 것은 다릅니다. 수는 그날 고쳤고, 검사의 자리는 아직 정하지 않았습니다 — 기본 회귀에 넣으면 커밋마다 40초가 더 듭니다. 그 판단은 검사가 아니라 사람이 합니다.

05 보탤 것

정 · 반 · 합 — 다섯

모양「오판의 모양」 7종을 만들어두고 장부 50건 중 0건에 붙였습니다. 설계 문서 안에서만 살고 있었습니다. 장부에 배선하고, 이번 주에 나온 두 건부터 붙입니다
게이트변이 시험은 25분이 걸려 커밋마다 못 겁니다. 주 1회 CI 로 올리고, 규율 문서를 건드리는 커밋에 한해 요구합니다. 잡는 수가 줄면 되돌립니다 — 저쪽의 롤백 규칙을 그 자리에만 씁니다
기각저는 채택된 뒤 틀린 것은 남깁니다. 채택되지 않은 제안은 커밋이 안 되므로 사라집니다. 장부에 «기각됨» 상태를 더합니다 — 문제는 열려 있고 그 안이 기각된 것입니다
raw원본 전량은 넣지 않습니다 — 용량도 문제고 비공개가 섞입니다. 색인만 넣습니다. 그러면 원본이 사라졌을 때 색인이 그 사실을 말해줍니다. 지금은 사라져도 모릅니다
전이규율 하나를 골라 자매 저장소 하나에서 무는지만 확인합니다. 「같은 DNA 를 공유한다」가 검증되지 않은 말로 남지 않게

가져오지 않을 것도 둘 정했습니다. 총점 게이트는 가져오지 않습니다 — 항목별로 무는지를 보는 능력을 하나의 수로 합치면 그 능력이 사라집니다. 그리고 「지식층을 감추는 이유」를 저쪽 것으로 바꿔 적지 않습니다 — 제 맥락에서 아직 검증되지 않았습니다. 남의 근거를 내 행동에 갖다 붙이는 것 자체가 대리 지표를 실제로 착각하는 모양입니다.

06 요지

루프는 이쪽이 정교하고, 무엇을 넣을지는 저쪽이 명시적입니다

저는 검증 루프를 저쪽보다 세밀하게 만들었습니다 — 항목별로, 반대 방향까지. 그 루프 안에 무엇을 넣을지는 저쪽이 더 분명하게 정해두었습니다. 넣지 않은 것들이 낡습니다. 등록부의 58과, 안 돌던 검사가 그 증거입니다. 둘 다 같은 날 나왔습니다.

재지 않은 것은 재지 않았다고 적었습니다. 저쪽 수치는 전부 인용이고, 이쪽 수치는 전부 명령으로 센 것입니다. 페이지의 수치는 손으로 쓰지 않고 계약에서 가져옵니다 — 그것이 이 페이지가 말하는 규칙이기도 합니다.

지식이 흩어지는 자리 /keep 어떻게 하는지 /method
사람이 읽는 것지금방법증거할 수 있는 것과 없는 것
깊이 보는 것숙박 운영을 시스템으로기록이 남는 곳발견되지 않는 이유띄우는 데서 막히는 자리지식이 흩어지는 자리없어도 돌아가게 만드는 자리AI가 실제 일에 붙는 자리기대던 것이 사라졌을 때BOM·ECO 를 그래프로검사가 보는 층만 살아남습니다
왜 여기서 멈추는 걸까요했던 걸 또 하고 있습니다제가 없으면 안 돌아갑니다다 만들었는데 띄우지를 못합니다잘 만들었는데 아무도 모릅니다AI를 배웠는데 정작 일에는 안 씁니다
다른 언어Seo Hyoda
AI·검색이 읽는 곳기계가 읽는 것

이 지도는 실제로 배포된 페이지에서 생성됩니다. 손으로 든 목록이 아닙니다.