datumo/E-Star-12B-v2-Base

  • ์†Œ์œ ์ž: Selectstar Eval Team
  • ์ž‘์„ฑ์ผ: 2026-05-22
  • ์ƒํƒœ: Active
  • ๋ฌธ์„œ์ƒ ๋ฒ„์ „: v0.1
  • Hugging Face ID: datumo/E-Star-12B-v2-Base

๋น„์ƒ์—…์  ์‚ฌ์šฉ ์ „์šฉ(Non-Commercial Use Only)
๋ณธ ๋ชจ๋ธ์€ Gemma 3์˜ ํŒŒ์ƒ ๋ชจ๋ธ์ด๋ฏ€๋กœ Gemma Terms of Use๊ฐ€ ์ ์šฉ๋ฉ๋‹ˆ๋‹ค. Selectstar๊ฐ€ ๋ณด์œ ํ•œ ์ˆ˜์ •๋ถ„์—๋Š” CC BY-NC 4.0 ๊ธฐ๋ฐ˜์˜ ์ถ”๊ฐ€ ๋น„์ƒ์—… ์กฐ๊ฑด์ด ์ ์šฉ๋ฉ๋‹ˆ๋‹ค. ๋‘ ์กฐ๊ฑด์„ ๋ชจ๋‘ ์ค€์ˆ˜ํ•ด์•ผ ํ•˜๋ฉฐ, ์ƒ์—…์  ์ด์šฉ์€ Selectstar์™€ ๋ณ„๋„ ๊ณ„์•ฝ์ด ํ•„์š”ํ•ฉ๋‹ˆ๋‹ค.


1. ๋ชจ๋ธ ์„ค๋ช…

1.1 ๋ชจ๋ธ ์•„ํ‚คํ…์ฒ˜ / ํŒŒ๋ผ๋ฏธํ„ฐ ํฌ๊ธฐ

ํ•ญ๋ชฉ ๋‚ด์šฉ
๋ฒ ์ด์Šค ๋ชจ๋ธ google/gemma-3-12b-it
๋ชจ๋ธ ๊ณ„์—ด Gemma 3
์•„ํ‚คํ…์ฒ˜ Transformer ๊ธฐ๋ฐ˜ Decoder ๊ณ„์—ด
ํŒŒ๋ผ๋ฏธํ„ฐ ํฌ๊ธฐ ์•ฝ 12B
ํ•™์Šต ๋ฐฉ์‹ Full Fine-Tuning ๊ธฐ๋ฐ˜ SFT
๋ชจ๋ธ ์œ ํ˜• ํ•œ๊ตญ์–ด ๋ฃจ๋ธŒ๋ฆญ ๊ธฐ๋ฐ˜ Evaluation Model
์ฃผ์š” ์ถœ๋ ฅ feedback โ†’ highlight โ†’ decision
์ฃผ์š” ์–ธ์–ด ํ•œ๊ตญ์–ด

๋ณธ ๋ชจ๋ธ์€ ์ฃผ์–ด์ง„ ๋ฌธ์ œ, ๋ชจ๋ธ ์‘๋‹ต, ํ‰๊ฐ€ ๊ธฐ์ค€๊ณผ ์ ์ˆ˜๋ณ„ ๋ฃจ๋ธŒ๋ฆญ์„ ํ•ด์„ํ•œ ๋’ค ํ‰๊ฐ€ ์„ค๋ช…, ํ•ต์‹ฌ ๊ทผ๊ฑฐ ๊ตฌ๊ฐ„ ๋ฐ ์ตœ์ข… ์ ์ˆ˜๋ฅผ ๊ตฌ์กฐํ™”๋œ ํ˜•์‹์œผ๋กœ ์ƒ์„ฑํ•œ๋‹ค.

Gemma 3 12B๋Š” ๋ฉ€ํ‹ฐ๋ชจ๋‹ฌ ์ž…๋ ฅ์„ ์ง€์›ํ•˜๋Š” ๋ชจ๋ธ ๊ณ„์—ด์ด์ง€๋งŒ, ๋ณธ ๋ชจ๋ธ์˜ ํ•™์Šต ๋ฐ ํ‰๊ฐ€ ๋ฒ”์œ„๋Š” ํ˜„์žฌ ๋ฌธ์„œ ๊ธฐ์ค€ ํ…์ŠคํŠธ ์ž…๋ ฅ์œผ๋กœ ์ œํ•œ๋œ๋‹ค. ์ด๋ฏธ์ง€ ์ž…๋ ฅ ์„ฑ๋Šฅ์€ ๊ฒ€์ฆ๋˜์ง€ ์•Š์•˜๋‹ค.

1.2 ๋ชจ๋ธ ์ œ์ž‘์— ์‚ฌ์šฉํ•œ GitHub ์ €์žฅ์†Œ

ํ•ญ๋ชฉ ๋‚ด์šฉ
ํ•™์Šต ์ €์žฅ์†Œ ํ™•์ธ ํ•„์š”
ํ‰๊ฐ€ ์ €์žฅ์†Œ ํ™•์ธ ํ•„์š”
์ถ”๋ก ยท์„œ๋น™ ์ €์žฅ์†Œ ํ™•์ธ ํ•„์š”
ํ•™์Šต commit ๋˜๋Š” tag ํ™•์ธ ํ•„์š”
Config ๊ฒฝ๋กœ ํ™•์ธ ํ•„์š”

์‹ค์ œ ๋ชจ๋ธ ์ œ์ž‘์— ์‚ฌ์šฉํ•œ ์ €์žฅ์†Œ URL๊ณผ ์žฌํ˜„ ๊ฐ€๋Šฅํ•œ commit hash ๋˜๋Š” release tag๋ฅผ ์ถ”๊ฐ€ํ•ด์•ผ ํ•œ๋‹ค. ๋‚ด๋ถ€ ์ €์žฅ์†Œ๋ผ๋ฉด ์ ‘๊ทผ ๊ถŒํ•œ๊ณผ ๋‹ด๋‹น ์กฐ์ง์„ ํ•จ๊ป˜ ๊ธฐ์žฌํ•œ๋‹ค.

1.3 ๋ชจ๋ธ ๋ฒ„์ „ ์ •๋ณด

ํ•ญ๋ชฉ ๋‚ด์šฉ
Hugging Face ์ €์žฅ์†Œ๋ช… E-Star-12B-v2-Base
๋ฌธ์„œ์ƒ ๋ฒ„์ „ v0.1
๋ฒ„์ „ ์„ค๋ช… K2-Feedback ๊ธฐ๋ฐ˜ 3๋‹จ๊ณ„ ํ•„ํ„ฐ๋ง ๋ฐ์ดํ„ฐ 6,311๊ฐœ๋กœ ํ•™์Šตํ•œ ์ดˆ๊ธฐ Base ๋ฒ„์ „
ํ•™์Šต ์ฒดํฌํฌ์ธํŠธ ํ™•์ธ ํ•„์š”

์ €์žฅ์†Œ๋ช…์˜ v2์™€ ๋ฌธ์„œ ๋ฒ„์ „ v0.1์˜ ์˜๋ฏธ๊ฐ€ ํ˜ผ์žฌ๋˜์–ด ์žˆ๋‹ค. v2๊ฐ€ ์ œํ’ˆ ์„ธ๋Œ€์ด๊ณ  v0.1์ด ์ฒดํฌํฌ์ธํŠธ ๋ฒ„์ „์ด๋ผ๋ฉด ์ด๋ฅผ ๋ช…์‹œํ•˜๊ณ , ๊ทธ๋ ‡์ง€ ์•Š๋‹ค๋ฉด ๋ชจ๋ธ๋ช…๊ณผ ๋ฒ„์ „์„ ํ†ต์ผํ•ด์•ผ ํ•œ๋‹ค.

1.4 ๋ชฉ์  / ์‚ฌ์šฉ ์‚ฌ๋ก€

E-Star-12B-v2-Base๋Š” ํ•œ๊ตญ์–ด ํ™˜๊ฒฝ์—์„œ evaluator๊ฐ€ ์ฃผ์–ด์ง„ ๋ฃจ๋ธŒ๋ฆญ์„ ์–ผ๋งˆ๋‚˜ ์ •ํ™•ํ•˜๊ณ  ์ผ๊ด€๋˜๊ฒŒ ์ ์šฉํ•˜๋Š”์ง€ ํ‰๊ฐ€ํ•˜๊ณ  ์ž๋™ํ™”ํ•˜๊ธฐ ์œ„ํ•œ ๋ชจ๋ธ์ด๋‹ค.

ํ‰๊ฐ€ ์ถ• ์„ค๋ช…
Faithfulness ๋ชจ๋ธ ์‘๋‹ต์ด ์ œ๊ณต๋œ ๋ฌธ์„œ์— ๊ทผ๊ฑฐํ•˜๋Š”์ง€ ํŒ๋‹จ
Context Relevancy ๊ฒ€์ƒ‰๋œ ๋ฌธ์„œ๊ฐ€ ์‚ฌ์šฉ์ž ์งˆ์˜์™€ ๊ด€๋ จ๋˜๋Š”์ง€ ํŒ๋‹จ
Response Relevancy ๋ชจ๋ธ ์‘๋‹ต์ด ์‚ฌ์šฉ์ž ์งˆ์˜์— ์ ์ ˆํžˆ ๋Œ€์‘ํ•˜๋Š”์ง€ ํŒ๋‹จ
Rubric Following ์ž„์˜์˜ ํ‰๊ฐ€ ๊ธฐ์ค€๊ณผ ์ ์ˆ˜๋ณ„ ์„ค๋ช…์„ ์ผ๊ด€๋˜๊ฒŒ ์ ์šฉํ•˜๋Š”์ง€ ํŒ๋‹จ

์ฃผ์š” ์‚ฌ์šฉ ์‚ฌ๋ก€๋Š” ๋‹ค์Œ๊ณผ ๊ฐ™๋‹ค.

  • ๊ธˆ์œตยท๋ฒ•๋ฅ  RAG ํŒŒ์ดํ”„๋ผ์ธ ํ’ˆ์งˆ ํ‰๊ฐ€
  • ๋ชจ๋ธ ์‘๋‹ต์— ๋Œ€ํ•œ 1~5์  ๋ฃจ๋ธŒ๋ฆญ ํ‰๊ฐ€
  • ํ‰๊ฐ€ ๊ทผ๊ฑฐ ๋ฐ ํ•ต์‹ฌ ํ…์ŠคํŠธ ๊ตฌ๊ฐ„ ์ถ”์ถœ
  • LLM ์‘๋‹ต ํ’ˆ์งˆ ๋ชจ๋‹ˆํ„ฐ๋ง๊ณผ ํšŒ๊ท€ ํ…Œ์ŠคํŠธ
  • ์‚ฌ๋žŒ ํ‰๊ฐ€ ์ด์ „์˜ 1์ฐจ ์ž๋™ ํ‰๊ฐ€
  • Frontier judge ๋ชจ๋ธ ๋Œ€๋น„ ๋น„์šฉ ํšจ์œจ์ ์ธ ๋‚ด๋ถ€ evaluator

1.5 ๋ชจ๋ธ ์‘์šฉ ๊ฐ€๋Šฅ์„ฑ

  • ๋„๋ฉ”์ธ๋ณ„ ๋ฃจ๋ธŒ๋ฆญ์„ ์ถ”๊ฐ€ํ•˜์—ฌ ๊ธˆ์œตยท๋ฒ•๋ฅ  ์™ธ ๋ถ„์•ผ๋กœ ํ™•์žฅ
  • ์ผ๋ฐ˜ instruction following ๋ฐ reasoning ์‘๋‹ต ํ‰๊ฐ€
  • RAG ๊ฒ€์ƒ‰๊ธฐยท์ƒ์„ฑ๊ธฐยทํ”„๋กฌํ”„ํŠธ ๊ฐ„ ๋น„๊ต ํ‰๊ฐ€
  • ๋ฐ์ดํ„ฐ ํ’ˆ์งˆ ๊ฒ€์ˆ˜์™€ ํ•™์Šต ์ƒ˜ํ”Œ ์šฐ์„ ์ˆœ์œ„ ์„ ๋ณ„
  • ์ ์ˆ˜์™€ ์ž์—ฐ์–ด ํ”ผ๋“œ๋ฐฑ์ด ํ•จ๊ป˜ ํ•„์š”ํ•œ ํ‰๊ฐ€ ํŒŒ์ดํ”„๋ผ์ธ

์ƒˆ๋กœ์šด ๋„๋ฉ”์ธ์— ์ ์šฉํ•  ๋•Œ๋Š” ์ „๋ฌธ๊ฐ€ ๊ฒ€์ˆ˜ ๋ฐ์ดํ„ฐ๋กœ ๋ณ„๋„ ์„ฑ๋Šฅ ๊ฒ€์ฆ์ด ํ•„์š”ํ•˜๋‹ค.


2. ๋ชจ๋ธ ์‹คํ–‰ ๋ฐฉ๋ฒ•

2.1 ์‹คํ–‰ ํ™˜๊ฒฝ

ํ•ญ๋ชฉ ๋‚ด์šฉ
Python ํ™•์ธ ํ•„์š”
PyTorch ํ™•์ธ ํ•„์š”
Transformers ํ™•์ธ ํ•„์š”
TRL ํ™•์ธ ํ•„์š”
์ •๋ฐ€๋„ BF16
์‹คํ–‰ ์žฅ์น˜ CUDA GPU ๊ถŒ์žฅ

2.2 ํ•™์Šต ์ฝ”๋“œ ์Šค๋‹ˆํŽซ

์•„๋ž˜ ์ฝ”๋“œ๋Š” ์ œ๊ณต๋œ ์„ค์ •์„ ์š”์•ฝํ•œ ์˜ˆ์‹œ๋‹ค. ์‹ค์ œ ์žฌํ˜„์—๋Š” ํ•™์Šต ์ €์žฅ์†Œ, ์ „์ฒ˜๋ฆฌ ์ฝ”๋“œ์™€ ์ •ํ™•ํ•œ ํŒจํ‚ค์ง€ ๋ฒ„์ „์ด ํ•„์š”ํ•˜๋‹ค.

import torch
from transformers import AutoModelForCausalLM, AutoTokenizer
from trl import SFTConfig, SFTTrainer

BASE_MODEL = "google/gemma-3-12b-it"

tokenizer = AutoTokenizer.from_pretrained(
    BASE_MODEL,
    trust_remote_code=True,
)
model = AutoModelForCausalLM.from_pretrained(
    BASE_MODEL,
    torch_dtype=torch.bfloat16,
    trust_remote_code=True,
)

sft_config = SFTConfig(
    output_dir="./outputs/e-star-12b-v2-base",
    per_device_train_batch_size=1,
    gradient_accumulation_steps=8,
    learning_rate=1e-5,
    num_train_epochs=5,
    eval_strategy="epoch",
    save_strategy="epoch",
    load_best_model_at_end=True,
    metric_for_best_model="eval_loss",
    greater_is_better=False,
    bf16=True,
    logging_steps=10,
)

trainer = SFTTrainer(
    model=model,
    args=sft_config,
    train_dataset=train_dataset,
    eval_dataset=eval_dataset,
    processing_class=tokenizer,
)
trainer.train()

num_train_epochs=5์™€ โ€œ2 epoch์—์„œ early stoppingโ€์€ ์„œ๋กœ ๋‹ค๋ฅธ ์ •๋ณด๋‹ค. Early stopping์„ ์‚ฌ์šฉํ–ˆ๋‹ค๋ฉด callback, patience์™€ ์‹ค์ œ ์ข…๋ฃŒ epoch๋ฅผ ํ•™์Šต ๋กœ๊ทธ ๊ธฐ์ค€์œผ๋กœ ๋ช…์‹œํ•ด์•ผ ํ•œ๋‹ค.

2.3 ์ถ”๋ก  ์ฝ”๋“œ ์Šค๋‹ˆํŽซ

import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

MODEL_ID = "datumo/E-Star-12B-v2-Base"

tokenizer = AutoTokenizer.from_pretrained(
    MODEL_ID,
    trust_remote_code=True,
)
model = AutoModelForCausalLM.from_pretrained(
    MODEL_ID,
    torch_dtype=torch.bfloat16,
    device_map="auto",
    trust_remote_code=True,
)
model.eval()

system_prompt = """You are a rubric evaluator.
Evaluate the response strictly according to the provided rubric.
Return exactly <feedback>, <highlight>, and <decision>."""

user_prompt = """You MUST write all output in the same language as the input.

# Data to Evaluate
### Problem
ํ•œ ๊ณต์žฅ์—์„œ ํ•˜๋ฃจ์— 120๊ฐœ์˜ ์ œํ’ˆ์„ ์ƒ์‚ฐํ•œ๋‹ค. ๋ถˆ๋Ÿ‰๋ฅ ์ด 5%์ผ ๋•Œ,
์ผ์ฃผ์ผ ๋™์•ˆ ์ƒ์‚ฐ๋˜๋Š” ์ •์ƒ ์ œํ’ˆ์˜ ์ˆ˜๋Š”?

### Model Response
ํ•˜๋ฃจ ์ •์ƒ ์ œํ’ˆ์€ 120 - (120 ร— 0.05) = 114๊ฐœ์ด๋ฉฐ,
์ผ์ฃผ์ผ ์ •์ƒ ์ œํ’ˆ์€ 114 ร— 7 = 798๊ฐœ์ด๋‹ค.

### Optional Ground Truth
798๊ฐœ

# Rubric
์ •๋‹ต์˜ ์ •ํ™•์„ฑ๊ณผ ํ’€์ด ๊ณผ์ •์˜ ๋…ผ๋ฆฌ์  ์ผ๊ด€์„ฑ์„ 1์ ์—์„œ 5์ ์œผ๋กœ ํ‰๊ฐ€ํ•œ๋‹ค.
"""

messages = [
    {"role": "system", "content": system_prompt},
    {"role": "user", "content": user_prompt},
]
inputs = tokenizer.apply_chat_template(
    messages,
    tokenize=True,
    add_generation_prompt=True,
    return_tensors="pt",
    return_dict=True,
).to(model.device)

with torch.inference_mode():
    outputs = model.generate(
        **inputs,
        max_new_tokens=2048,
        do_sample=False,
    )

new_tokens = outputs[0, inputs["input_ids"].shape[1]:]
print(tokenizer.decode(new_tokens, skip_special_tokens=True))

์‹ค์ œ ํ•™์Šต์— ์‚ฌ์šฉํ•œ ์ „์ฒด prompt, ์ถœ๋ ฅ ํŒŒ์„œ์™€ generation config๋ฅผ ํ•จ๊ป˜ ์ œ๊ณตํ•ด์•ผ ํ‰๊ฐ€ ๊ฒฐ๊ณผ๋ฅผ ์žฌํ˜„ํ•  ์ˆ˜ ์žˆ๋‹ค.


3. ํ•™์Šต ๋ฐ์ดํ„ฐ์…‹ ์„ค๋ช…

3.1 ๋ฐ์ดํ„ฐ ์ถœ์ฒ˜ ๋ฐ ํŠน์„ฑ

ํ•ญ๋ชฉ ๋‚ด์šฉ
์‹œ๋“œ ๋ฐ์ดํ„ฐ K2-Feedback (HAERAEHUB, 2024)
์‹œ๋“œ ๋ฐ์ดํ„ฐ ๊ทœ๋ชจ ์•ฝ 99,700๊ฐœ
์ตœ์ข… ํ•™์Šต ๋ฐ์ดํ„ฐ 6,311๊ฐœ
์–ธ์–ด ํ•œ๊ตญ์–ด
ํ•„๋“œ system, user, assistant
์ถœ๋ ฅ ๊ตฌ์กฐ feedback โ†’ highlight โ†’ decision
์ƒ์„ฑ ์œ ํ˜• Human+AI
๋ ˆ์ด๋ธ” ๊ฒ€์ฆ ๋ณต์ˆ˜ ๋ชจ๋ธ ํ•ฉ์˜ ๋ฐ frontier ๋ชจ๋ธ ๊ต์ฐจ ๊ฒ€์ฆ

3.2 ํ•„ํ„ฐ๋ง ํŒŒ์ดํ”„๋ผ์ธ

๋‹จ๊ณ„ ๊ทœ๋ชจ ๋ณ€ํ™” ์ฒ˜๋ฆฌ ๋ฐฉ๋ฒ•
Stage 1 99.7K โ†’ 26K Qwen3-30B-A3B-Instruct-2507๊ณผ Qwen3-Next-80B-A3B-Instruct์˜ ์ดˆ๊ธฐ ํ•ฉ์˜
Stage 2 26K โ†’ 8K Gemma ํŒ๋‹จ๊ณผ Qwen ํ•ฉ์˜ ๊ฐ„ ์ผ์น˜ยท๋ถˆ์ผ์น˜ ์ƒ˜ํ”Œ ๊ท ํ˜•ํ™”
Stage 3 8K โ†’ 6,311 GPT-5.2 ๋‹จ์ผ ํ‰๊ฐ€, ์†Œํ˜• frontier debate์™€ Qwen ํ•ฉ์˜ ๊ต์ฐจ ๊ฒ€์ฆ

์ตœ์ข… ๋ฐ์ดํ„ฐ๋Š” ์„ธ ํŒ๋‹จ ๊ฒฝ๋กœ ์ค‘ ์ตœ์†Œ ๋‘ ๊ฒฝ๋กœ ์ด์ƒ์ด ๋™์ผ ๋ ˆ์ด๋ธ”์„ ์ง€์ง€ํ•œ ์ƒ˜ํ”Œ๋กœ ๊ตฌ์„ฑ๋œ๋‹ค.

3.3 ํ‰๊ฐ€ ๋ฒค์น˜๋งˆํฌ

  • datumo/Feedback-Bench
    • ์˜์–ดยทํ•œ๊ตญ์–ด rubric following ํ‰๊ฐ€
    • 5์  ์ฒ™๋„, reference-free, debate ๊ธฐ๋ฐ˜ ์žฌ๋ ˆ์ด๋ธ”๋ง
  • datumo/Rag-Quality-Bench
    • ๊ธˆ์œตยท๋ฒ•๋ฅ  domain adaptation ํ‰๊ฐ€
    • Context Relevancy, Faithfulness, Response Relevancy

3.4 ๋ฐ์ดํ„ฐ ๋ˆ„์ˆ˜ ํ™•์ธ

ํ•™์Šต ๋ฐ์ดํ„ฐ์™€ ํ‰๊ฐ€ ๋ฒค์น˜๋งˆํฌ๊ฐ€ ์œ ์‚ฌํ•œ debate ์ ˆ์ฐจ๋ฅผ ์‚ฌ์šฉํ•˜๋ฏ€๋กœ instruction, response, rubric, ์›์ฒœ ๋ฌธ์„œ์™€ ์ƒ์„ฑ ๋ชจ๋ธ ์กฐํ•ฉ์˜ ์ค‘๋ณต ์—ฌ๋ถ€๋ฅผ ํ™•์ธํ•ด์•ผ ํ•œ๋‹ค.


4. ํ•™์Šต ์„ค์ •

4.1 ์ฃผ์š” ํ•™์Šต ํŒŒ๋ผ๋ฏธํ„ฐ

ํ•ญ๋ชฉ ์„ค์ •
ํ•™์Šต ๋ฐฉ์‹ Full Fine-Tuning
ํ”„๋ ˆ์ž„์›Œํฌ TRL SFTTrainer
Learning rate 1e-5
์ตœ๋Œ€ epoch 5
์‹ค์ œ ์ข…๋ฃŒ epoch 2๋กœ ๊ธฐ์žฌ๋˜์–ด ์žˆ์œผ๋‚˜ ๋กœ๊ทธ ํ™•์ธ ํ•„์š”
Per-device batch size 1
Gradient accumulation 8
Precision BF16
Evaluation strategy Epoch
Save strategy Epoch
Best-model metric Validation loss
LoRA ์‚ฌ์šฉํ•˜์ง€ ์•Š์Œ
Optimizer / Scheduler ํ™•์ธ ํ•„์š”
Max sequence length ํ™•์ธ ํ•„์š”
Random seed ํ™•์ธ ํ•„์š”

4.2 GPU ๋ฐ ํ•™์Šต ์‹œ๊ฐ„

ํ•ญ๋ชฉ ๋‚ด์šฉ
GPU ๊ฐœ์ˆ˜ 4๊ฐœ
GPU ๋ชจ๋ธ ํ™•์ธ ํ•„์š”
GPU๋‹น ๋ฉ”๋ชจ๋ฆฌ ํ™•์ธ ํ•„์š”
๋ถ„์‚ฐ ํ•™์Šต ๋ฐฉ์‹ ํ™•์ธ ํ•„์š”
์ด ํ•™์Šต ์‹œ๊ฐ„ ์•ฝ 1.2์‹œ๊ฐ„

GPU: 4๋งŒ์œผ๋กœ๋Š” ์žฌํ˜„ํ•  ์ˆ˜ ์—†์œผ๋ฏ€๋กœ A100, H100, H200 ๋“ฑ ์ •ํ™•ํ•œ GPU ๋ชจ๋ธ๊ณผ ๋ฉ”๋ชจ๋ฆฌ ์šฉ๋Ÿ‰์„ ์ถ”๊ฐ€ํ•ด์•ผ ํ•œ๋‹ค.


5. ํ‰๊ฐ€ ๊ฒฐ๊ณผ

5.1 Feedback Bench โ€” ์˜์–ด Rubric Following

Type Model Pearson Kendall ฯ„ Spearman
Frontier GPT-5.2 0.916 0.865 0.911
Frontier Sonnet-4.6 0.840 0.776 0.847
Instruct SLM Gemma-3-12B-IT 0.810 0.725 0.794
Instruct SLM oss-20b 0.844 0.762 0.839
Evaluator LM Prometheus-8x7B-v2.0 0.823 0.736 0.806
Evaluator LM GLIDER 3.8B 0.678 0.595 0.688
Ours E-Star-12B-Base 0.856 0.778 0.847

5.2 Ko Feedback Bench โ€” ํ•œ๊ตญ์–ด Rubric Following

Type Model Pearson Kendall ฯ„ Spearman
Frontier GPT-5.2 0.929 0.886 0.925
Frontier Sonnet-4.6 0.820 0.758 0.833
Instruct SLM Gemma-3-12B-IT 0.653 0.593 0.661
Instruct SLM oss-20b 0.778 0.704 0.779
Evaluator LM Prometheus-8x7B-v2.0 0.377 0.441 0.501
Evaluator LM GLIDER 3.8B 0.523 0.487 0.563
Ours E-Star-12B-Base 0.826 0.754 0.819

5.3 RAG Quality Bench โ€” ๊ธˆ์œตยท๋ฒ•๋ฅ  Domain Adaptation

Model LAW CR LAW F LAW RR FIN CR FIN F FIN RR Average
GPT-5.2 0.846 0.785 0.941 0.882 0.740 0.970 0.861
Sonnet-4.6 0.910 0.786 0.872 0.932 0.845 0.925 0.878
Gemma-3-12B-IT 0.620 0.742 0.742 0.830 0.713 0.821 0.745
oss-20b 0.846 0.722 0.870 0.793 0.752 0.900 0.813
Prometheus-8x7B-v2.0 0.392 0.477 0.772 0.386 0.240 0.806 0.512
GLIDER 3.8B 0.657 0.670 0.680 0.432 0.415 0.548 0.567
E-Star-12B-Base 0.853 0.730 0.816 0.835 0.720 0.880 0.806

CR์€ Context Relevancy, F๋Š” Faithfulness, RR์€ Response Relevancy๋ฅผ ์˜๋ฏธํ•œ๋‹ค.

5.4 ๊ฒฐ๊ณผ ํ•ด์„

  • E-Star๋Š” Feedback Bench์™€ Ko Feedback Bench์—์„œ ๋ฒ ์ด์Šค ๋ชจ๋ธ๋ณด๋‹ค ๋†’์€ ์ƒ๊ด€๋„๋ฅผ ๊ธฐ๋กํ–ˆ๋‹ค.
  • RAG Quality ํ‰๊ท ์€ 0.806์œผ๋กœ Gemma-3-12B-IT์˜ 0.745๋ณด๋‹ค ๋†’์ง€๋งŒ GPT-5.2, Sonnet-4.6๊ณผ oss-20b๋ณด๋‹ค๋Š” ๋‚ฎ๋‹ค.
  • Faithfulness๋Š” ๋ฒ•๋ฅ  0.730, ๊ธˆ์œต 0.720์œผ๋กœ ๋ฒ ์ด์Šค ๋ชจ๋ธ๋ณด๋‹ค ๋‚ฎ๊ฑฐ๋‚˜ ์œ ์‚ฌํ•ด ์ง€ํ‘œ๋ณ„ ์ทจ์•ฝ์  ๋ถ„์„์ด ํ•„์š”ํ•˜๋‹ค.

5.5 ํ‰๊ฐ€ ์žฌํ˜„ ์ •๋ณด

ํ‰๊ฐ€ ์ฝ”๋“œ์™€ commit, ๋ฒค์น˜๋งˆํฌ revision, ๋ชจ๋ธ ๋ฒ„์ „, prompt, generation config, ์ถœ๋ ฅ ํŒŒ์‹ฑ ๊ทœ์น™, ํ‰๊ฐ€์ผ๊ณผ ์‹ ๋ขฐ๊ตฌ๊ฐ„์„ ์ถ”๊ฐ€ํ•ด์•ผ ํ•œ๋‹ค.

Evaluation report: ํ™•์ธ ํ•„์š”
Evaluation repository: ํ™•์ธ ํ•„์š”
Raw result artifact: ํ™•์ธ ํ•„์š”

6. ํ•œ๊ณ„

  1. Ko Feedback Bench์˜ ๊ธฐ๊ณ„๋ฒˆ์—ญ ๋…ธ์ด์ฆˆ๊ฐ€ ์„ฑ๋Šฅ ์ธก์ •์— ์˜ํ–ฅ์„ ์ค„ ์ˆ˜ ์žˆ๋‹ค.
  2. ํ•™์Šต ๋ฐ์ดํ„ฐ์™€ ๋ฒค์น˜๋งˆํฌ๊ฐ€ ์œ ์‚ฌํ•œ debate ์ ˆ์ฐจ๋กœ ๊ตฌ์ถ•๋˜์–ด ํŠน์ • judge ํ•ฉ์˜ ๊ธฐ์ค€๊ณผ์˜ ์ •๋ ฌ์„ ์ธก์ •ํ•  ์ˆ˜ ์žˆ๋‹ค.
  3. ๋„๋ฉ”์ธ ์ „๋ฌธ๊ฐ€์˜ ๋…๋ฆฝ์ ์ธ human evaluation์ด ์ˆ˜ํ–‰๋˜์ง€ ์•Š์•˜๋‹ค.
  4. Reference-free ์„ค์ •์œผ๋กœ ํ•™์Šตยทํ‰๊ฐ€๋˜์–ด reference ํฌํ•จ ํ™˜๊ฒฝ์€ ๋ณ„๋„ ๊ฒ€์ฆ์ด ํ•„์š”ํ•˜๋‹ค.
  5. ๋ณต์žกํ•˜๊ฑฐ๋‚˜ ์ƒ์ถฉํ•˜๋Š” ๋ฃจ๋ธŒ๋ฆญ์—์„œ๋Š” frontier ๋ชจ๋ธ๋ณด๋‹ค ํŒ๋‹จ ์„ฑ๋Šฅ์ด ๋‚ฎ์„ ์ˆ˜ ์žˆ๋‹ค.
  6. ์ž…๋ ฅ ๋ฌธ์„œ ์ˆ˜์™€ context ๊ธธ์ด ์ฆ๊ฐ€์— ๋”ฐ๋ฅธ ์„ฑ๋Šฅ ๋ณ€ํ™”๊ฐ€ ๊ฒ€์ฆ๋˜์ง€ ์•Š์•˜๋‹ค.
  7. ๊ธˆ์œตยท๋ฒ•๋ฅ  ์™ธ ๋„๋ฉ”์ธ์˜ ์ผ๋ฐ˜ํ™” ์„ฑ๋Šฅ์ด ํ™•์ธ๋˜์ง€ ์•Š์•˜๋‹ค.
  8. ๊ตฌ์กฐํ™” ์ถœ๋ ฅ ํƒœ๊ทธ์˜ ๋ˆ„๋ฝยท์ค‘๋ณตยท์ˆœ์„œ ์˜ค๋ฅ˜์— ๋Œ€ํ•œ ํŒŒ์‹ฑ ์‹คํŒจ์œจ์ด ์ธก์ •๋˜์ง€ ์•Š์•˜๋‹ค.
  9. ๋ฒ ์ด์Šค ๋ชจ๋ธ์€ ๋ฉ€ํ‹ฐ๋ชจ๋‹ฌ์ด์ง€๋งŒ ๋ณธ evaluator์˜ ์ด๋ฏธ์ง€ ์ž…๋ ฅ ์„ฑ๋Šฅ์€ ๊ฒ€์ฆ๋˜์ง€ ์•Š์•˜๋‹ค.

7. ๋ผ์ด์„ ์Šค

7.1 ์ ์šฉ ๋ผ์ด์„ ์Šค ๊ตฌ์กฐ

๋ณธ ๋ชจ๋ธ์—๋Š” ๋‹ค์Œ ์กฐ๊ฑด์ด ํ•จ๊ป˜ ์ ์šฉ๋œ๋‹ค.

  1. Google์˜ Gemma Terms of Use
  2. Selectstar๊ฐ€ ์ž์ฒด ์ˆ˜์ •๋ถ„์— ๋ถ€์—ฌํ•œ CC BY-NC 4.0 ๊ธฐ๋ฐ˜ ์ถ”๊ฐ€ ๋น„์ƒ์—… ์กฐ๊ฑด
๊ตฌ์„ฑ ์š”์†Œ ์ ์šฉ ์กฐ๊ฑด
๋ฒ ์ด์Šค ๋ชจ๋ธ google/gemma-3-12b-it Gemma Terms of Use
Gemma ๊ธฐ๋ฐ˜ ํŒŒ์ƒ ๊ฐ€์ค‘์น˜ Gemma Terms of Use
Selectstar๊ฐ€ ๋ณด์œ ํ•œ ์ˆ˜์ •๋ถ„ CC BY-NC 4.0 ๊ธฐ๋ฐ˜ ์ถ”๊ฐ€ ๋น„์ƒ์—… ์กฐ๊ฑด
ํ•™์Šต ๋ฐ์ดํ„ฐ K2-Feedback ์›๋ณธ ๋ฐ์ดํ„ฐ์…‹ ๋ผ์ด์„ ์Šค ํ™•์ธ ํ•„์š”
ํ•™์Šตยทํ‰๊ฐ€ ์ฝ”๋“œ ์ €์žฅ์†Œ๋ณ„ ๋ผ์ด์„ ์Šค ํ™•์ธ ํ•„์š”

Hugging Face YAML์—์„œ๋Š” ๋‹จ์ผ ๋ผ์ด์„ ์Šค๋กœ ์˜คํ•ด๋˜์ง€ ์•Š๋„๋ก license: other๋กœ ํ‘œ๊ธฐํ•˜์˜€๋‹ค.

7.2 ํ—ˆ์šฉ๋˜๋Š” ์ด์šฉ

  • ๋น„์ƒ์—…์  ํ•™์ˆ  ์—ฐ๊ตฌ
  • ๋น„์˜๋ฆฌ ๊ต์œก
  • ๊ฐœ์ธ ํ•™์Šต ๋ฐ ์‹คํ—˜
  • ์ถœ์ฒ˜์™€ ๋ณ€๊ฒฝ์‚ฌํ•ญ์„ ๋ช…์‹œํ•œ ๋น„์ƒ์—…์  ์ˆ˜์ •ยท์—ฐ๊ตฌ

์žฌ๋ฐฐํฌ๋Š” Gemma Terms์™€ Selectstar์˜ ์ถ”๊ฐ€ ์กฐ๊ฑด์„ ๋ชจ๋‘ ์ถฉ์กฑํ•ด์•ผ ํ•˜๋ฏ€๋กœ ๋ณ„๋„ ๊ฒ€ํ† ๊ฐ€ ํ•„์š”ํ•˜๋‹ค.

7.3 ๋ณ„๋„ ๊ณ„์•ฝ ์—†์ด ํ—ˆ์šฉ๋˜์ง€ ์•Š๋Š” ์ด์šฉ

  • ์œ ๋ฃŒ ์ œํ’ˆยท์„œ๋น„์Šค์— ๋ชจ๋ธ ํ†ตํ•ฉ
  • ์œ ๋ฃŒ API ๋˜๋Š” hosted service ์ œ๊ณต
  • ์‚ฌ๋‚ด ์ƒ์—… ์šด์˜ ์‹œ์Šคํ…œ์ด๋‚˜ ๊ณ ๊ฐ ๋Œ€๋ฉด ์„œ๋น„์Šค ์ ์šฉ
  • ๋ชจ๋ธ ๊ฐ€์ค‘์น˜์˜ ํŒ๋งค ๋˜๋Š” ์ƒ์—…์  ์žฌ๋ฐฐํฌ
  • ์ƒ์—…์  ๋ชจ๋ธ ํ•™์Šต์„ ์œ„ํ•œ ๋ฐ์ดํ„ฐ ์ƒ์„ฑ
  • ๊ธฐํƒ€ ์ง์ ‘์ ยท๊ฐ„์ ‘์  ์ˆ˜์ต ์ฐฝ์ถœ ๋ชฉ์ ์˜ ์ด์šฉ

์ƒ์—…์  ์ด์šฉ์—๋Š” Selectstar์™€ ๋ณ„๋„ ๊ณ„์•ฝ์ด ํ•„์š”ํ•˜๋ฉฐ, ๋ณ„๋„ ๊ณ„์•ฝ ํ›„์—๋„ Gemma Terms๋Š” ๊ณ„์† ์ ์šฉ๋œ๋‹ค.

7.4 Gemma ํŒŒ์ƒ ๋ชจ๋ธ ๋ฐฐํฌ ์กฐ๊ฑด

Gemma ํŒŒ์ƒ ๋ชจ๋ธ์˜ ์ œ3์ž ์ œ๊ณต๊ณผ hosted service๋Š” Gemma Terms์ƒ Distribution์— ํฌํ•จ๋  ์ˆ˜ ์žˆ๋‹ค. ๋ฐฐํฌ ์‹œ์—๋Š” ๋‹ค์Œ ์กฐ๊ฑด์„ ํ™•์ธํ•ด์•ผ ํ•œ๋‹ค.

  • Gemma ์‚ฌ์šฉ ์ œํ•œ์„ ์ง‘ํ–‰ ๊ฐ€๋Šฅํ•œ ์กฐ๊ฑด์œผ๋กœ ํฌํ•จ
  • ์ˆ˜๋ น์ธ์—๊ฒŒ Gemma Terms ์ ์šฉ ์‚ฌ์‹ค ๊ณ ์ง€ ๋ฐ ์•ฝ๊ด€ ์‚ฌ๋ณธ ์ œ๊ณต
  • ์ˆ˜์ •๋œ ํŒŒ์ผ์— ๋ณ€๊ฒฝ ์‚ฌ์‹ค ํ‘œ์‹œ
  • ์š”๊ตฌ๋˜๋Š” NOTICE ํŒŒ์ผ ์ œ๊ณต
  • Gemma Prohibited Use Policy ์ค€์ˆ˜
  • ์ถ”๊ฐ€ ์กฐ๊ฑด์ด Gemma Terms์™€ ์ถฉ๋Œํ•˜์ง€ ์•Š๋Š”์ง€ ํ™•์ธ

7.5 ํ•™์Šต ๋ฐ์ดํ„ฐ ๋ผ์ด์„ ์Šค

K2-Feedback์˜ ์ •ํ™•ํ•œ ๋ผ์ด์„ ์Šค๋ช…๊ณผ ํŒŒ์ƒ ๋ฐ์ดํ„ฐ ๋ฐ ๋ชจ๋ธ ํ•™์Šต ํ—ˆ์šฉ ๋ฒ”์œ„๊ฐ€ ํ˜„์žฌ ๋ฌธ์„œ์— ๊ธฐ์žฌ๋˜์–ด ์žˆ์ง€ ์•Š๋‹ค. ํ™•์ธ ์ „๊นŒ์ง€ ํ•™์Šต ๋ฐ์ดํ„ฐ ์›๋ฌธ์„ ๋ชจ๋ธ ์ €์žฅ์†Œ์— ํฌํ•จํ•˜๊ฑฐ๋‚˜ ์™ธ๋ถ€์— ์žฌ๋ฐฐํฌํ•˜์ง€ ์•Š๋Š”๋‹ค.

7.6 ๊ถŒ์žฅ ๋ผ์ด์„ ์Šค ๊ณ ์ง€

E-Star-12B-v2-Base is a model derivative of google/gemma-3-12b-it.

Use and distribution of the model weights are subject to the Gemma
Terms of Use. Additional non-commercial terms based on CC BY-NC 4.0
apply to modifications owned by Selectstar.

Users must comply with both sets of terms. Commercial use requires
a separate agreement with Selectstar and remains subject to the
Gemma Terms of Use and the Gemma Prohibited Use Policy.

7.7 ์ƒ์—…์  ์ด์šฉ ๋ฌธ์˜

์ƒ์—…์  ๋ผ์ด์„ ์Šค๊ฐ€ ํ•„์š”ํ•œ ๊ฒฝ์šฐ Selectstar ๊ณต์‹ ์ฑ„๋„์„ ํ†ตํ•ด ๋ฌธ์˜ํ•œ๋‹ค.

Downloads last month
279
Safetensors
Model size
12B params
Tensor type
F32
ยท
Inference Providers NEW
This model isn't deployed by any Inference Provider. ๐Ÿ™‹ Ask for provider support

Model tree for datumo/E-star-12B-base

Finetuned
(401)
this model
Quantizations
2 models

Collections including datumo/E-star-12B-base