# Vision Fine-tuning Example # Train LLaMA-Vision on image-caption pairs # Uses LLaVA format (image + conversation) model: llama-vision-13b # LLaMA-3.2-Vision-90B or similar data: path: examples/data/vision_dataset.jsonl format: llava image_dir: examples/data/images/ task: sft modality: vision backend: transformers quantization: int8 lora_r: 128 lora_alpha: 256 lora_dropout: 0.1 lora_target_modules: - q_proj - v_proj - k_proj - out_proj batch_size: 4 gradient_accumulation_steps: 4 num_epochs: 2 learning_rate: 1e-4 lr_scheduler_type: cosine warmup_ratio: 0.1 weight_decay: 0.01 max_seq_length: 4096 output_dir: ./output_vision/ seed: 42 logging_steps: 10 save_steps: 50