# Kuinka ladata tiedostoja Python-ohjelmaan pandas read\_csv() -toiminnolla

Python pandas `read_csv()` on yksi yleisimmin käytetyistä menetelmistä **CSV-tiedostojen lukemiseen pandasiin ja niiden tallentamiseen DataFrames-muodossa**. CSV-tiedostot (*komalla erotetut arvot*) ovat laajalti käytetty muoto taulukkomuotoisten tietojen tallentamiseen, ja monet sovellukset tukevat niitä.

## Mikä on Python pandas `read_csv()`:n syntaksi?

`pandas.read_csv()` luo [pandas DataFrame](https://www.ionos.com/fi-fi/digitalguide/verkkosivustot/verkkosivujen-kehittaeminen/python-pandas-dataframe/) -kehyksen CSV-tiedostosta. Funktion perusrakente on seuraavanlainen:

```python
import pandas as pd
df = pd.read_csv(filepath_or_buffer, sep=',', header='infer', names=None, index_col=None, usecols=None, dtype=None, ...)
```

### Mitkä ovat tärkeimmät parametrit `pandas.read_csv()`:lle?

`pandas.read_csv()` voi hyväksyä **monenlaisia parametreja**. Yksinkertaisuuden vuoksi keskitymme tärkeimpiin argumentteihin. Tässä on yleiskatsaus tärkeimmistä parametreista, joita voit käyttää määrittämään, miten funktio toimii:

<table>
  <thead>
    <tr>
      <th><strong>Parametri</strong></th>
      <th><strong>Merkitys</strong></th>
      <th><strong>Oletusarvo</strong></th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>`filepath_or_buffer`</td>
      <td>Tämä on Python-merkkijono, joka edustaa CSV-tiedoston polkua tai datapuskuriin, kuten URL-osoitetta.</td>
      <td></td>
    </tr>
    <tr>
      <td>`sep`</td>
      <td>Tämä määrittää arvojen välisen erottimen.</td>
      <td>`,`</td>
    </tr>
    <tr>
      <td>`header`</td>
      <td>Ilmaisee, mitä riviä käytetään otsikkona.</td>
      <td>`infer` (ensimmäinen rivi)</td>
    </tr>
    <tr>
      <td>`names`</td>
      <td>Jos `header=None` on asetettu, voit käyttää `names` sarakkeiden nimien Python-luettelon antamiseen.</td>
      <td></td>
    </tr>
    <tr>
      <td>`index_col`</td>
      <td>Määrittää, mitä saraketta käytetään indeksinä.</td>
      <td>`None`</td>
    </tr>
    <tr>
      <td>`usecols`</td>
      <td>Tämän parametrin avulla voit valita, mitkä sarakkeet haluat ladata DataFrame-kehykseen.</td>
      <td>`None`</td>
    </tr>
    <tr>
      <td>`dtype`</td>
      <td>Määrittää sarakkeiden tietotyypin.</td>
      <td>`None`</td>
    </tr>
  </tbody>
</table>

Tämän toiminnon parametrien kattava luettelo löytyy [pandas-dokumentaatiosta](https://pandas.pydata.org/pandas-docs/stable/reference/api/pandas.read_csv.html).

## CSV-tiedostojen avaaminen vaihe vaiheelta

`pandas.read_csv()` avulla voit helposti siirtää tietoja CSV-tiedostoista Python-ohjelmaan vain muutamalla vaiheella.

Seuraavissa esimerkeissä käytämme CSV-tiedostoa, jonka rakenne on seuraava:

```none
1,John Avery,35,Nottingham,50000
2,Adelaide Smith,29,London,62000
3,Michael Rivera,41,Cardiff,40000
4,Grace Kim,33,Hull,35000
5,Tyler Johnson,28,Kent,52000
```

### Vaihe 1: Tuo pandas

Ensinnäkin, tuo pandas-kirjasto Python-skriptiisi.

```python
import pandas as pd
```

### Vaihe 2: Lataa CSV-tiedosto

Nyt voit ladata CSV-tiedoston Python pandasiin käyttämällä `read_csv()`. Syötä vain **tiedoston polku** funktiolle. Seuraavassa koodissa käytämme tiedostoa nimeltä *data.csv*, joka on tallennettu samaan hakemistoon kuin skripti:

```python
df = pd.read_csv('data.csv')
```

Yllä oleva koodi tallentaa tiedoston DataFrame-objektiin (`df`), jota voimme sitten käyttää. **Pandas tulkitsee ensimmäisen rivin automaattisesti sarakkeiden otsikoiksi**, ellet määritä toisin.

### Vaihe 3: Näytä CSV-tiedosto

On hyvä tarkistaa **DataFrame-taulukon ensimmäiset rivit** varmistaaksesi, että tiedosto on ladattu oikein. Voit käyttää tähän `DataFrame.head()`. Oletusarvoisesti se näyttää DataFrame-taulukon viisi ensimmäistä riviä, jolloin saat nopeasti yleiskuvan tietojen rakenteesta:

```python
print(df.head())
```

Tulostus näyttää tältä:

```none
0  1        John Avery   35      Nottingham  	50000
1  2    Adelaide Smith   29   	 London 	    62000
2  3   Michael Rivera    41      Cardiff	   	40000
3  4        Grace Kim    33      Hull 		    35000
4  5    Tyler Johnson    28      Kent   		52000
```

### Vaihe 4: Muuta sarakkeiden nimiä (valinnainen)

Jos CSV-tiedostossasi ei ole otsikkoriviä, voit määrittää sarakkeiden nimet manuaalisesti:

```python
df = pd.read_csv('data.csv', header=None, names=['ID', 'Name', 'Age', 'City', 'Salary'])
```

Tässä esimerkissä olemme nimenneet sarakkeet *ID*, *Nimi*, *Ikä*, *Kaupunki* ja *Palkka*. Tulostus näyttää tältä:

```none
ID                Name    	Age            City    	Salary
0  1          John Avery    	35        Nottingham    50000
1  2     Adelaide Smith    	29    	London        62000
2  3    Michael Rivera    	41        Cardiff    	40000
3  4          Grace Kim    	33        Hull        	35000
4  5     Tyler Johnson    	28        Kent        52000
```

Huomio Käyttämässämme esimerkissä oli pieni määrä dataa, joten sen hallinta oli helppoa. Jos sinulla on kuitenkin **suuri CSV-tiedosto**, on hyvä lukea se pandasiin paloina, jotta vältät muistiongelmat. Voit käyttää parametria `pandas.read_csv()` `chunksize` määrittääksesi, kuinka monta riviä kerrallaan luetaan. Pythonin for-silmukan avulla voit iteroida palat.


This is a markdown version of: [https://www.ionos.com/fi-fi/digitalguide/verkkosivustot/verkkosivujen-kehittaeminen/python-pandas-read-csv/](https://www.ionos.com/fi-fi/digitalguide/verkkosivustot/verkkosivujen-kehittaeminen/python-pandas-read-csv/) for AI/LLM consumption.