报错信息
/home/jizhi/anaconda3/envs/llm/lib/python3.10/site-packages/torch/utils/checkpoint.py:87: UserWarning: None of the inputs have requires_grad=True. Gradients will be None
warnings.warn(
{'loss': 24435.127, 'grad_norm': 0.0, 'learning_rate': 0.0, 'epoch': 0.05}
{'loss': 3054.3909, 'grad_norm': 0.0, 'learning_rate': 3.0303030303030305e-07, 'epoch': 0.09}
{'loss': 0.0, 'grad_norm': 0.0, 'learning_rate': 6.060606060606061e-07, 'epoch': 0.14}
{'loss': 9163.1729, 'grad_norm': 0.0, 'learning_rate': 9.090909090909091e-07, 'epoch': 0.18}
脚本
export PYTHONPATH=$PYTHONPATH:/home/shiym/projects/MedM-VL
deepspeed --include localhost:0 --master_port 29501 lvlm/train.py \
--deepspeed scripts/train/utils/zero2.json \
--data_path /home/jizhi/code/ad/data/data.json \
--conv_version qwen2 \
--image_path /home/jizhi/code/data/ad \
--training_recipe common \
--tune_type_llm lora \
--llm_lora_r 128 \
--llm_lora_alpha 256 \
--llm_lora_dropout 0.05 \
--llm_lora_bias none \
--tune_type_encoder_image frozen \
--tune_type_connector_image full \
--bf16 True \
--gradient_checkpointing True \
--output_dir work_dirs/MedM-VL-2D-3B-en-finetune \
--resume_from_checkpoint /home/jizhi/code/models/shiym2000/MedM-VL-2D-3B-en \
--dataloader_num_workers 2 \
--dataloader_pin_memory True \
--dataloader_persistent_workers True \
--num_train_epochs 100 \
--per_device_train_batch_size 2 \
--gradient_accumulation_steps 8 \
--learning_rate 2e-5 \
--weight_decay 0.0 \
--warmup_ratio 0.03 \
--lr_scheduler_type cosine \
--eval_strategy no \
--save_strategy no \
--report_to tensorboard \
--logging_steps 1
报错信息
/home/jizhi/anaconda3/envs/llm/lib/python3.10/site-packages/torch/utils/checkpoint.py:87: UserWarning: None of the inputs have requires_grad=True. Gradients will be None
warnings.warn(
{'loss': 24435.127, 'grad_norm': 0.0, 'learning_rate': 0.0, 'epoch': 0.05}
{'loss': 3054.3909, 'grad_norm': 0.0, 'learning_rate': 3.0303030303030305e-07, 'epoch': 0.09}
{'loss': 0.0, 'grad_norm': 0.0, 'learning_rate': 6.060606060606061e-07, 'epoch': 0.14}
{'loss': 9163.1729, 'grad_norm': 0.0, 'learning_rate': 9.090909090909091e-07, 'epoch': 0.18}
脚本