Tag: Benchmark
All the articles with the tag "Benchmark".
-
디폴트값으로 돌리고 있었다 — GPT-5.6 Luna 추론 옵션을 medium과 high로 나눠서 비교해본 결과
GPT-5.6 Luna의 reasoning_effort 기본값을 발견하고 medium/high를 프롬프트 보강과 엮어 벤치마크를 돌렸다. 결과표는 그럴듯했다. 그런데 그 표를 만든 도구를 다시 열어보니, 표에 있는 숫자 중 상당수는 애초에 그 코드가 잴 수 없는 값이었다 — 그리고 그걸 고친 정정 문서에도, 또 다른 정정이 필요했다.