벤치마크를 ‘만드는’ 시대는 끝났다 — 이제 자연어로 지시한다
모델이 좋아졌는지, 더 이상 ‘채점지 잘 보기’로는 알 수 없다. MMLU 같은 고정 벤치마크는 포화됐고, 리더보드는 게임의 대상이 됐다. 그리고 우리가 모델에게 실제로 시키는 일 — 코드를 쓰고, 도구를 끼워 쓰고, 복잡한 문제를 끝까지 푸는 일 — 은 전통 벤치마크가 거의 측정하지
Writing / Page 13
모델이 좋아졌는지, 더 이상 ‘채점지 잘 보기’로는 알 수 없다. MMLU 같은 고정 벤치마크는 포화됐고, 리더보드는 게임의 대상이 됐다. 그리고 우리가 모델에게 실제로 시키는 일 — 코드를 쓰고, 도구를 끼워 쓰고, 복잡한 문제를 끝까지 푸는 일 — 은 전통 벤치마크가 거의 측정하지
내 크론 잡을 죽인 건 에러가 아니라 ‘예산 초과’였다 “Script timed out after 60s.” 새벽에 크론 잡 상태를 확인했을 때, 내 잡 하나가 에러로 찍혀 있었다. 첫 반응은 당연히 버그 찾기였다. 코드를 뒤지고, 로그를 뒤지고, ‘어느 라인이 60초를 넘기지?’라고
작년 12월, 나는 PPC 툴 하나에 반했다. 데모 보고, 요금제 비교하고, 거의 계약서에 사인할 뻔했다. 그리고 4개월 뒤 그 툴을 다시는 켜지 않았다. 새로웠을 뿐이었다. 기능은 좋았는데, 내 워크플로에 들어갈 자리는 없었다. 이게 퍼포먼스 마케터의 현실이다. AI 툴은 넘치고, 선
민감한 사이트에서 title 태그 하나로 SEO와 안전을 동시에 해결할 수 없는 이유를 공개 사례와 기술적 쟁점으로 정리한다.
내 서버를 죽인 건 버그가 아니라 테스트였다 “cron-scheduler DOWN.” 새벽에 잠들기 전, 그동안 고치고 있던 크론 모듈의 테스트 스위트를 마지막으로 한 번 돌렸다. 그 몇 분 뒤, 내 서버를 지키는 스케줄러가 죽었다는 알람이 왔다. 원인은 내가 방금 돌린 그 테스트였다.
“다음에 뭘 물어보지?” — Ahrefs MCP가 남긴 마지막 문제 경쟁사가 구글 1면에 랭킹하는 키워드, 지난 몇 달간 유기 트래픽이 자라난 사이트, 6개월 뒤 피크가 오는 시즌성 키워드. SEO 업무의 상당수는 사실상 “데이터를 조회하고 읽는” 반복이다. Ahrefs MCP 서버가
검색엔진에는 사이트의 목적이 분명하게 보여야 하지만, 브라우저에는 그 목적이 위험한 흔적으로 남지 않아야 한다. 공개 사례를 바탕으로 검색 노출과 브라우저 흔적을 함께 점검하는 방법을 정리한다.
AI는 당신의 글을 읽지 않는다. 수확한다. 스토리를 즐기러 오는 독자가 아니라, 답변을 조립할 재료를 찾아 나가는 수확기다. Search Engine Land가 올린 “How to create answer-first content that AI models actually cite”라
리드가 죽는 건 폴더 정리를 못 해서가 아니다 나는 최근에 한 가지 리서치를 시작했다. 주제는 하나였다. “프리랜서와 에이전시는 리드를 어떻게 다루고 있을까?” 하루 종일 문서를 뒤지고, 커뮤니티의 수천 개 댓글을 훑고, 리드 관리 도구의 가격표를 전부 펼쳐봤다. 그리고 리서치를 마칠
AI 답변에 내 글이 인용됐다. 좋은 소식이다. 그런데 그 답변을 본 사람 중 단 한 명도 내 사이트를 클릭하지 않았다. 그리고 곰곰이 생각해보니, 그게 당연했다. 최근 읽은 Search Engine Land의 answer-first 가이드(“How to create answer-fir
20년간 자동화를 설계해온 건 애드 플랫폼이었다. 이번엔 아니다. Search Engine Land에 이런 글이 하나 떴다. 글쓴이는 Frederick Vallaeys — Optmyzr의 CEO이자, Google에서 10년을 일하며 최초의 AdWords Editor를 만드는 데 참여했고
GEO에 올인하고 있다면, 지금부터 읽을 이야기가 조금 불편할 수도 있다. BrightEdge 조사에 따르면 68%의 브랜드가 AI 검색(GEO) 흐름을 잡기 위해 검색 전략을 바꾸고 있다. 그 수치 자체는 놀랍지 않다. ChatGPT가 나온 지 벌써 3년, 그 파도를 못 본 척할 사람