Reddit
Открытые 4B-модели достигают уровня o3 в решении медицинских вопросов на шведском
Автор протестировал небольшие открытые LLM (MedGemma-1.5-4B, Gemma4-E4B, Qwen3.5-4B) на шведских медицинских экзаменах. Модель Qwen3.5-4B без дообучения достигла 87% точности с включённым режимом рассуждений, превзойдя GPT-4 и o3 в этом конкретном наборе данных. Эксперимент демонстрирует эффективность малых моделей для специализированных задач и работу с рассуждениями на редких языках.
score 40r/MachineLearning