# Guia rápido sobre o método Pandas describe()

A função `DataFrame.describe()` da Biblioteca Python Pandas serve para gerar um resumo estatístico das colunas numéricas de um DataFrame. Esse resumo inclui indicadores estatísticos importantes, como média, desvio padrão, mínimo, máximo e vários quantis dos dados.

## Sintaxe de `describe()` em Pandas

A sintaxe básica da função `describe()` no Pandas não é complicada e é a seguinte:

```python
DataFrame.describe(percentiles=None, include=None, exclude=None)
```

### Parâmetros relevantes

Com a ajuda de alguns parâmetros, poderá realizar ajustes na saída da função `describe()`. Esses parâmetros são:

<table>
  <thead>
    <tr>
      <th><strong>Parâmetro</strong></th>
      <th><strong>Descrição</strong></th>
      <th><strong>Valor padrão</strong></th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>`percentiles`</td>
      <td>Enumera os quantis desejados que devem ser incluídos na descrição</td>
      <td>`[.25, .5, .75]`</td>
    </tr>
    <tr>
      <td>`include`</td>
      <td>Determine quais tipos de dados devem ser incluídos na descrição. Os valores podem ser `numpy.number`, `numpy.object`, `all` ou `None`</td>
      <td>`None`</td>
    </tr>
    <tr>
      <td>`exclude`</td>
      <td>Determina quais tipos de dados devem ser excluídos da descrição. Os valores são análogos aos de `include`</td>
      <td>`None`</td>
    </tr>
  </tbody>
</table>

Definição Os quantis estatísticos são valores que dividem um conjunto de dados ordenados em segmentos de tamanho igual e mostram qual a percentagem dos pontos de dados que se encontra abaixo desse limiar. Os quantis são muito úteis para compreender a distribuição dos dados e podem incluir, por exemplo, a mediana (percentil 50), o percentil 25 e o percentil 75.

## Utilização de `describe()` em Pandas

O método `DataFrame.describe()` do Pandas é usado principalmente para obter rapidamente os principais indicadores estatísticos de um conjunto de dados.

### Exemplo 1: Resumo estatístico de dados numéricos

No exemplo seguinte, é analisado o DataFrame `df`, que contém uma série de dados de vendas:

```python
import pandas as pd
import numpy as np
# Ejemplo de DataFrame con datos de ventas
data = {
    'Product': ['A', 'B', 'C', 'D', 'E'],
    'Quantity': [10, 20, 15, 5, 30],
    'Price': [100, 150, 200, 80, 120],
    'Revenue': [1000, 3000, 3000, 400, 3600]
}
df = pd.DataFrame(data)
print(df)
```

Em seguida, podemos usar `describe()` do Pandas para obter um resumo estatístico das colunas numéricas:

```python
summary = df.describe()
print(summary)
```

A chamada para a função `DataFrame.describe()` gera o seguinte resultado:

```none
Quantity       Price      Revenue
count   5.000000    5.000000     5.000000
mean   16.000000  130.000000  2200.000000
std     9.617692   46.904158  1407.124728
min     5.000000   80.000000   400.000000
25%    10.000000  100.000000  1000.000000
50%    15.000000  120.000000  3000.000000
75%    20.000000  150.000000  3000.000000
max    30.000000  200.000000  3600.000000
```

Estes números têm o seguinte significado:

- `count`: quantidade de entradas não NaN
- `mean`: média dos valores (também visível com [`DataFrame.mean()`](https://www.ionos.com/pt-pt/digitalguide/paginas-web/desenvolvimento-web/pandas-dataframemean-em-python/))
- `std`: desvio padrão dos valores
- `min, 25%, 50%, 75%, max`: mínimo, percentil 25, mediana (percentil 50), percentil 75, máximo dos valores

### Exemplo 2: Ajuste dos quantis

Pode ajustar a função `DataFrame.describe()` do Pandas com os parâmetros descritos anteriormente para incluir quartis específicos.

```python
# Resumen estadístico con cuantiles ajustados
custom_summary = df.describe(percentiles=[0.1, 0.5, 0.9])
print(custom_summary)
```

A partir dos quantis que escolhemos, ou seja, 10 %, 50 % (mediana) e 90 %, a chamada da função fornece o seguinte resultado:

```none
Quantity       Price      Revenue
count   5.000000    5.000000     5.000000
mean   16.000000  130.000000  2200.000000
std     9.617692   46.904158  1407.124728
min     5.000000   80.000000   400.000000
10%     7.000000   88.000000   640.000000
50%    15.000000  120.000000  3000.000000
90%    26.000000  180.000000  3360.000000
max    30.000000  200.000000  3600.000000
```


This is a markdown version of: [https://www.ionos.com/pt-pt/digitalguide/paginas-web/desenvolvimento-web/funcao-describe-para-dataframes-do-pandas-em-python/](https://www.ionos.com/pt-pt/digitalguide/paginas-web/desenvolvimento-web/funcao-describe-para-dataframes-do-pandas-em-python/) for AI/LLM consumption.