soup/examples/configs/vision_llama.yaml

34 lines
691 B
YAML

# Vision Fine-tuning Example
# Train LLaMA-Vision on image-caption pairs
# Uses LLaVA format (image + conversation)
model: llama-vision-13b # LLaMA-3.2-Vision-90B or similar
data:
path: examples/data/vision_dataset.jsonl
format: llava
image_dir: examples/data/images/
task: sft
modality: vision
backend: transformers
quantization: int8
lora_r: 128
lora_alpha: 256
lora_dropout: 0.1
lora_target_modules:
- q_proj
- v_proj
- k_proj
- out_proj
batch_size: 4
gradient_accumulation_steps: 4
num_epochs: 2
learning_rate: 1e-4
lr_scheduler_type: cosine
warmup_ratio: 0.1
weight_decay: 0.01
max_seq_length: 4096
output_dir: ./output_vision/
seed: 42
logging_steps: 10
save_steps: 50