# Mikä on pandas DataFrame describe() -metodi?

Python pandas -funktiota `DataFrame.describe()` käytetään tuottamaan tilastollinen yhteenveto DataFrame-taulukon numeerisista sarakkeista. Tämä yhteenveto sisältää keskeisiä tilastollisia mittareita, kuten keskiarvon, keskihajonnan, minimin, maksimin ja erilaisia prosenttipisteitä.

## Mikä on pandas-kirjaston `describe()` syntaksi?

DataFrame-taulukoiden `describe()` perusrakenteet ovat yksinkertaisia. Ne näyttävät tältä:

```python
DataFrame.describe(percentiles=None, include=None, exclude=None)
```

### Pandas-kirjaston tärkeät parametrit `DataFrame.describe()`

Seuraavien parametrien avulla voit säätää `describe()`:n ulostuloa:

<table>
  <thead>
    <tr>
      <th><strong>Parametri</strong></th>
      <th><strong>Kuvaus</strong></th>
      <th><strong>Oletusarvo</strong></th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>`percentiles`</td>
      <td>Luettelee yhteenvetoon sisällytettävät prosenttipisteet.</td>
      <td>`[.25, .5, .75]`</td>
    </tr>
    <tr>
      <td>`include`</td>
      <td>Määrittää, mitkä tietotyypit sisällytetään kuvaukseen; mahdolliset arvot ovat `numpy.number`, `numpy.object`, `all` tai `None`.</td>
      <td>`None`</td>
    </tr>
    <tr>
      <td>`exclude`</td>
      <td>Määrittää, mitkä tietotyypit jätetään pois kuvauksesta; toimii kuten parametri `include`.</td>
      <td>`None`</td>
    </tr>
  </tbody>
</table>

Määritelmä Tilastolliset prosenttipisteet ovat arvoja, jotka jakavat lajitellun tietojoukon yhtä suuriin osiin ja osoittavat, kuinka suuri prosenttiosuus datapisteistä alittaa tietyn kynnysarvon. Näitä ovat esimerkiksi mediaani (50. prosenttipiste), 25. prosenttipiste ja 75. prosenttipiste. Nämä tiedot auttavat muodostamaan selkeämmän kuvan datan jakautumisesta.

## Esimerkkejä pandas `describe()`:n käytöstä

Jos tarvitset nopean yleiskatsauksen tietojoukon tärkeimmistä tilastollisista mittareista, pandas `DataFrame.describe()` -funktio on erittäin hyödyllinen.

### Esimerkki 1: Numeraalisten tietojen tilastollinen yhteenveto

Seuraavassa esimerkissä tarkastelemme DataFrame `df`ää, joka sisältää erilaisia myyntitietoja.

```python
import pandas as pd
import numpy as np
# Example DataFrame with sales data
data = {
    'Product': ['A', 'B', 'C', 'D', 'E'],
    'Quantity': [10, 20, 15, 5, 30],
    'Price': [100, 150, 200, 80, 120],
    'Revenue': [1000, 3000, 3000, 400, 3600]
}
df = pd.DataFrame(data)
print(df)
```

Nyt voit käyttää pandas `describe()` saadaksesi tilastollisen yhteenvedon sarakkeiden numeerisista tiedoista:

```python
summary = df.describe()
print(summary)
```

Pandas `DataFrame.describe()` -funktion tulos on seuraava:

```none
Quantity       Price      Revenue
count   5.000000    5.000000     5.000000
mean   16.000000  130.000000  2200.000000
std     9.617692   46.904158  1407.124728
min     5.000000   80.000000   400.000000
25%    10.000000  100.000000  1000.000000
50%    15.000000  120.000000  3000.000000
75%    20.000000  150.000000  3000.000000
max    30.000000  200.000000  3600.000000
```

Tuloksessa esitetyt keskeiset mittarit ovat:

- `count`: Ei-NaN (ei luku) -merkintöjen lukumäärä
- `mean`: Arvojen keskiarvo (saatavilla myös [DataFrame.mean()](https://www.ionos.com/fi-fi/digitalguide/verkkosivustot/verkkosivujen-kehittaeminen/python-pandas-dataframe-keskiarvo/)-funktiolla)
- `std`: Arvojen keskihajonta
- `min`, `25%`, `50%`, `75%`, `max`: Minimi-, 25. prosenttipiste-, mediaani- (50. prosenttipiste), 75. prosenttipiste- ja maksimiarvot

### Esimerkki 2: Prosenttipisteiden mukauttaminen

Voit mukauttaa pandas `DataFrame.describe()` -tuloksen prosenttipisteitä `percentiles` -parametrilla:

```python
# Statistical summary with custom percentiles
custom_summary = df.describe(percentiles=[0.1, 0.5, 0.9])
print(custom_summary)
```

Tämä funktiokutsu tuottaa seuraavan tuloksen:

```none
Quantity       Price      Revenue
count   5.000000    5.000000     5.000000
mean   16.000000  130.000000  2200.000000
std     9.617692   46.904158  1407.124728
min     5.000000   80.000000   400.000000
10%     7.000000   88.000000   640.000000
50%    15.000000  120.000000  3000.000000
90%    26.000000  180.000000  3360.000000
max    30.000000  200.000000  3600.000000
```

Tuloksessa on mukana `10%`, 50 % ja 90 % edellisen esimerkin vakioprosenttipisteiden sijaan.


This is a markdown version of: [https://www.ionos.com/fi-fi/digitalguide/verkkosivustot/verkkosivujen-kehittaeminen/python-pandas-dataframe-describe/](https://www.ionos.com/fi-fi/digitalguide/verkkosivustot/verkkosivujen-kehittaeminen/python-pandas-dataframe-describe/) for AI/LLM consumption.