Glavna težava pri branju datotek csv s spletnega strežnika je, da ločilo, uporabljeno v datoteki, morda ni enako kot ločilo, ki ga uporablja Python. To lahko povzroči napake pri poskusu uvoza podatkov v Python.
import csv
import urllib2
response = urllib2.urlopen('http://samplecsvs.s3.amazonaws.com/SalesJan2009.csv')
csv_file = csv.reader(response)
for row in csv_file:
print row
Ta koda uvozi modula csv in urllib2. Nato uporabi urllib2, da odpre url 'http://samplecsvs.s3.amazonaws.com/SalesJan2009.csv'. Koda nato ustvari spremenljivko csv_file, ki je nastavljena na funkcijo csv.reader in posreduje spremenljivko odziva kot argument. Koda nato uporabi zanko for za iteracijo skozi vsako vrstico v datoteki csv_file in vsako vrstico natisne na konzolo.
CSV datoteke
Datoteke CSV so datoteke z vrednostmi, ločenimi z vejicami. Običajno se uporabljajo za shranjevanje podatkov v obliki tabele. Datoteke CSV lahko bere Pythonov modul csv.
Spletni in CSV nasveti
Obstaja nekaj nasvetov za delo s spletnimi podatki in podatki CSV v Pythonu.
Najprej je pomembno razumeti, da obstajata dve različni vrsti podatkov: besedilni in binarni. Binarni podatki so sestavljeni iz 1 in 0, medtem ko je besedilni podatek samo niz znakov.
Pri delu z binarnimi podatki je pomembno, da uporabljate prava orodja. Na primer, knjižnico pandas lahko uporabite za branje in pisanje binarnih datotek.
Drugič, pri delu z datotekami CSV je pomembno spremljati imena stolpcev. Python ima vgrajeno funkcijo, imenovano split(), ki jo lahko uporabite za razdelitev datoteke v posamezne stolpce.
Nenazadnje si je pomembno tudi zapomniti, da so datoteke CSV z vejicami ločene vrednosti (CSV). To pomeni, da mora biti vsak stolpec naveden v ločeni vrstici.