AI модель — программа, которая учится на данных и делает предсказания.
Тренировочные данные → Обучение → Предсказания
Компоненты модели
# Датасет
dataset = [
{"input": "Отличный продукт!", "output": "positive"},
{"input": "Ужасное качество", "output": "negative"},
{"input": "Ничего особенного", "output": "neutral"},
]
# Обучение
model.train(dataset)
# Предсказание
label = model.predict("Классный товар!") # "positive"
Ключевые метрики
Accuracy — процент правильных ответов:
accuracy = correct / total # 85 / 100 = 0.85 → 85%
Loss — средняя ошибка:
loss = sum(abs(pred - real) for pred, real in zip(preds, actuals)) / len(preds)
Размер датасета и его влияние:
| Размер | Ожидаемая точность |
|--------|-------------------|
| < 1 000 | ~65% |
| 1 000–5 000 | ~80% |
| 5 000–10 000 | ~90% |
| > 10 000 | ~95%+ |
Типы моделей
| Тип | Задача | Пример |
|---|---|---|
| Classification | Определить категорию | Спам / не спам |
| Regression | Предсказать число | Цена квартиры |
| Generation | Создать контент | Текст, код, изображение |
Overfitting vs Underfitting
def check_fit(train_acc, test_acc):
if train_acc < 0.7 and test_acc < 0.7:
return "Underfitting — модель слабая, нужно больше данных"
if train_acc > 0.9 and test_acc < 0.7:
return "Overfitting — модель запомнила данные, нужна регуляризация"
return "Good Fit"
check_fit(0.95, 0.60) # Overfitting
check_fit(0.65, 0.63) # Underfitting
check_fit(0.88, 0.85) # Good Fit
Жизненный цикл
1. Сбор данных → собрать / разметить примеры
2. Обучение → model.fit(X_train, y_train)
3. Тестирование → model.evaluate(X_test, y_test)
4. Улучшение → больше данных / подбор гиперпараметров
5. Деплой → API / сервис для пользователей
Практические советы
- Разбивай датасет: 80% train / 20% test
- Следи за обоими метриками: высокий train acc + низкий test acc = overfitting
- Начинай просто: baseline модель → оценка → улучшение
- Качество > количество: 1 000 чистых примеров лучше 10 000 грязных
💬 Комментарии (0)
Комментариев пока нет
Станьте первым, кто поделится мнением об этой статье!